{"id":12778,"date":"2026-08-27T12:49:04","date_gmt":"2026-08-27T05:49:04","guid":{"rendered":"https:\/\/www.qiscus.com\/id\/?p=12778"},"modified":"2026-08-27T12:49:06","modified_gmt":"2026-08-27T05:49:06","slug":"dataset-chatbot","status":"publish","type":"post","link":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/","title":{"rendered":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data"},"content":{"rendered":"\n<p>Tim IT yang mau membangun chatbot sendiri biasanya berhenti di satu pertanyaan, dari mana dataset chatbot yang layak dipakai untuk melatih model. Dataset chatbot adalah kumpulan data percakapan, pasangan tanya jawab, atau dialog berlabel yang dipakai untuk melatih dan menguji model AI percakapan. Membangun dataset yang benar benar merepresentasikan pola percakapan pelanggan nyata ternyata jauh lebih berat daripada sekadar mengunduh file CSV dari internet.<\/p>\n\n\n\n<p>Artikel ini membahas jenis dataset chatbot yang tersedia, dan cara membangun dataset sendiri. Artikel ini juga membahas studi kasus nyata dari tim AI Qiscus yang membangun dataset dari nol untuk riset mereka sendiri. Di akhir, ada perbandingan build vs buy supaya keputusan tim lebih berdasar data, bukan asumsi.<\/p>\n\n\n\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_83 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Daftar Isi<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Apa_Itu_Dataset_Chatbot_dan_Jenis_Jenisnya\" >Apa Itu Dataset Chatbot dan Jenis Jenisnya<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Dataset_Open_Domain\" >1. Dataset Open Domain<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Dataset_Task_Oriented\" >2. Dataset Task Oriented<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Dataset_Customer_Support\" >3. Dataset Customer Support<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#4_Dataset_Multibahasa\" >4. Dataset Multibahasa<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Cara_Membangun_Dataset_Chatbot_dari_Nol\" >Cara Membangun Dataset Chatbot dari Nol<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Kumpulkan_Data_Percakapan_dari_Sumber_yang_Relevan\" >1. Kumpulkan Data Percakapan dari Sumber yang Relevan<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Bersihkan_dan_Anonimkan_Data_Sensitif\" >2. Bersihkan dan Anonimkan Data Sensitif<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Anotasi_Setiap_Percakapan_Secara_Manual\" >3. Anotasi Setiap Percakapan Secara Manual<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#4_Validasi_Kualitas_Label_Sebelum_Dipakai_untuk_Training\" >4. Validasi Kualitas Label Sebelum Dipakai untuk Training<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Studi_Kasus_Bagaimana_Tim_AI_Qiscus_Membangun_Dataset_Chatbot_Sendiri\" >Studi Kasus, Bagaimana Tim AI Qiscus Membangun Dataset Chatbot Sendiri<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Alasan_Tim_Qiscus_Membangun_Dataset_Sendiri\" >1. Alasan Tim Qiscus Membangun Dataset Sendiri<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-13\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Skala_dan_Proses_Anotasi_Dataset_QiscusCS\" >2. Skala dan Proses Anotasi Dataset QiscusCS<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-14\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Struktur_Data_yang_Dipakai_Tim_Qiscus\" >3. Struktur Data yang Dipakai Tim Qiscus<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-15\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#4_Dataset_Bagus_Saja_Tidak_Menjamin_Performa_Model\" >4. Dataset Bagus Saja Tidak Menjamin Performa Model<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-16\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Apa_yang_Bisa_Dipelajari_dari_Perbandingan_Arsitektur_di_Studi_Kasus_Ini\" >Apa yang Bisa Dipelajari dari Perbandingan Arsitektur di Studi Kasus Ini<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-17\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Model_Dasar_Kurang_Berpengaruh_pada_Sistem_Multi-Agent\" >1. Model Dasar Kurang Berpengaruh pada Sistem Multi-Agent<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-18\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Model_Dasar_Sangat_Berpengaruh_pada_Sistem_Single-Agent\" >2. Model Dasar Sangat Berpengaruh pada Sistem Single-Agent<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-19\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Waktu_Eskalasi_Memengaruhi_Akurasi_pada_Kasus_Sulit\" >3. Waktu Eskalasi Memengaruhi Akurasi pada Kasus Sulit<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-20\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#4_Satu_Metrik_Saja_Tidak_Cukup_untuk_Menilai_Kualitas_Model\" >4. Satu Metrik Saja Tidak Cukup untuk Menilai Kualitas Model<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-21\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Biaya_Tersembunyi_Membangun_Dataset_Chatbot_Sendiri\" >Biaya Tersembunyi Membangun Dataset Chatbot Sendiri<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-22\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Waktu_Domain_Expert_yang_Ikut_Teralokasi_ke_Anotasi\" >1. Waktu Domain Expert yang Ikut Teralokasi ke Anotasi<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-23\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Eksperimen_Arsitektur_yang_Butuh_Siklus_Trial_and_Error\" >2. Eksperimen Arsitektur yang Butuh Siklus Trial and Error<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-24\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Pemeliharaan_Dataset_yang_Berkelanjutan\" >3. Pemeliharaan Dataset yang Berkelanjutan<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-25\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Pertimbangan_Kepatuhan_Data_Saat_Membangun_Dataset_Chatbot\" >Pertimbangan Kepatuhan Data Saat Membangun Dataset Chatbot<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-26\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Anonimisasi_Bukan_Sekadar_Menghapus_Nama\" >1. Anonimisasi Bukan Sekadar Menghapus Nama<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-27\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Kepatuhan_terhadap_Undang_Undang_Pelindungan_Data_Pribadi\" >2. Kepatuhan terhadap Undang Undang Pelindungan Data Pribadi<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-28\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Akses_Terbatas_ke_Dataset_Mentah\" >3. Akses Terbatas ke Dataset Mentah<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-29\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Dataset_Chatbot_Sendiri_vs_AI_Agent_Siap_Pakai_Mana_yang_Lebih_Masuk_Akal\" >Dataset Chatbot Sendiri vs AI Agent Siap Pakai, Mana yang Lebih Masuk Akal<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-30\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Cara_AI_Agent_Siap_Pakai_Menghindarkan_Beban_Membangun_Dataset\" >Cara AI Agent Siap Pakai Menghindarkan Beban Membangun Dataset<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-31\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Knowledge_Base_Menggantikan_Kebutuhan_Dataset_Percakapan_Mentah\" >1. Knowledge Base Menggantikan Kebutuhan Dataset Percakapan Mentah<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-32\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Arsitektur_Sudah_Teruji_Tim_Tidak_Perlu_Eksperimen_Sendiri\" >2. Arsitektur Sudah Teruji, Tim Tidak Perlu Eksperimen Sendiri<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-33\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Fokus_Tim_Bergeser_ke_Konteks_Bisnis_Bukan_Rekayasa_Model\" >3. Fokus Tim Bergeser ke Konteks Bisnis, Bukan Rekayasa Model<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-34\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Cara_Memulai_Baik_Membangun_Sendiri_Maupun_Evaluasi_AI_Agent_Siap_Pakai\" >Cara Memulai, Baik Membangun Sendiri Maupun Evaluasi AI Agent Siap Pakai<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-35\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#1_Audit_Kapasitas_Tim_Data_Science_Internal\" >1. Audit Kapasitas Tim Data Science Internal<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-36\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#2_Petakan_Volume_dan_Jenis_Percakapan_yang_Perlu_Ditangani\" >2. Petakan Volume dan Jenis Percakapan yang Perlu Ditangani<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-37\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#3_Bandingkan_Estimasi_Waktu_ke_Produksi\" >3. Bandingkan Estimasi Waktu ke Produksi<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-38\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#4_Mulai_dari_Skala_Kecil_Sebelum_Komitmen_Penuh\" >4. Mulai dari Skala Kecil Sebelum Komitmen Penuh<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-39\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#5_Tinjau_Ulang_Keputusan_Setiap_Beberapa_Bulan\" >5. Tinjau Ulang Keputusan Setiap Beberapa Bulan<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-40\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Dataset_Bukan_Segalanya_Eksekusi_yang_Menentukan_Hasil\" >Dataset Bukan Segalanya, Eksekusi yang Menentukan Hasil<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-41\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#Pertanyaan_yang_Sering_Ditanyakan_tentang_Dataset_Chatbot\" >Pertanyaan yang Sering Ditanyakan tentang Dataset Chatbot<\/a><\/li><\/ul><\/nav><\/div>\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Apa_Itu_Dataset_Chatbot_dan_Jenis_Jenisnya\"><\/span>Apa Itu Dataset Chatbot dan Jenis Jenisnya<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Dataset chatbot adalah kumpulan pesan teks, dialog, atau pasangan tanya jawab yang dipakai untuk melatih dan menguji model AI percakapan. Kualitas dataset ini langsung menentukan seberapa baik model memahami konteks dan intent penggunanya.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Dataset_Open_Domain\"><\/span>1. Dataset Open Domain<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Dataset open domain berisi percakapan bebas dan kasual, misalnya dari subtitle film atau thread media sosial, yang dipakai untuk melatih bot percakapan umum. Jenis dataset ini cocok untuk chatbot yang perlu terdengar natural, tapi kurang cocok untuk kasus bisnis yang butuh presisi tinggi.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Dataset_Task_Oriented\"><\/span>2. Dataset Task Oriented<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Dataset task oriented berisi dialog terstruktur yang dirancang untuk tujuan spesifik, seperti memesan tiket atau melakukan reservasi. Setiap giliran percakapan biasanya berkaitan langsung dengan langkah menuju penyelesaian tugas tertentu.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Dataset_Customer_Support\"><\/span>3. Dataset Customer Support<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Dataset customer support berisi pasangan tanya jawab yang fokus pada deteksi intent dan penyelesaian masalah pelanggan. Jenis dataset inilah yang paling relevan untuk bisnis yang ingin membangun <a href=\"https:\/\/www.qiscus.com\/id\/blog\/ai-agent-customer-service\/\">AI Agent untuk customer service<\/a> mereka sendiri.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"4_Dataset_Multibahasa\"><\/span>4. Dataset Multibahasa<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Bisnis yang melayani pelanggan lintas bahasa membutuhkan dataset yang mencakup variasi bahasa dan dialek yang relevan dengan pasar mereka. Dataset semacam ini biasanya paling sulit didapat secara publik, karena representasi bahasa daerah atau campuran bahasa jarang tersedia dalam jumlah besar. Bisnis Indonesia yang melayani pelanggan berbahasa daerah atau campuran Bahasa Indonesia dan Inggris sering harus membangun dataset sendiri untuk kasus ini. Dataset publik yang tersedia kebanyakan berbahasa Inggris murni, kurang merepresentasikan pola bahasa campuran yang lazim dipakai pelanggan Indonesia.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Cara_Membangun_Dataset_Chatbot_dari_Nol\"><\/span>Cara Membangun Dataset Chatbot dari Nol<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Membangun dataset chatbot yang layak pakai untuk produksi memerlukan proses yang jauh lebih panjang daripada sekadar mengumpulkan teks percakapan. Empat tahap berikut adalah alur kerja standar yang biasa dipakai tim data science.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Kumpulkan_Data_Percakapan_dari_Sumber_yang_Relevan\"><\/span>1. Kumpulkan Data Percakapan dari Sumber yang Relevan<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Kumpulkan log percakapan nyata dari kanal yang sudah dipakai bisnis, seperti WhatsApp, live chat, atau email. Data sintetis bisa jadi pelengkap, tapi data percakapan nyata tetap lebih merepresentasikan pola bahasa pelanggan yang sebenarnya.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Bersihkan_dan_Anonimkan_Data_Sensitif\"><\/span>2. Bersihkan dan Anonimkan Data Sensitif<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Ganti semua informasi identitas pribadi seperti nama, email, dan nomor telepon dengan data dummy sebelum dataset dipakai untuk pelatihan. Langkah ini wajib dilakukan untuk menjaga privasi pelanggan sekaligus mematuhi regulasi perlindungan data.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Anotasi_Setiap_Percakapan_Secara_Manual\"><\/span>3. Anotasi Setiap Percakapan Secara Manual<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Setiap pesan dalam dataset perlu dilabeli sesuai kategori yang relevan, misalnya apakah pesan tersebut butuh eskalasi ke manusia atau bisa ditangani otomatis. Proses ini idealnya dilakukan oleh domain expert yang paham konteks bisnis, bukan sekadar anotator umum. Studi kasus QiscusCS menunjukkan pendekatan ini secara langsung. Tiga domain expert dari tim Customer Service dilibatkan khusus untuk memberi label pada setiap utterance. Anotator generik yang tidak familiar dengan konteks layanan pelanggan Qiscus tidak dilibatkan dalam proses ini.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"4_Validasi_Kualitas_Label_Sebelum_Dipakai_untuk_Training\"><\/span>4. Validasi Kualitas Label Sebelum Dipakai untuk Training<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Lakukan pengecekan silang antar anotator untuk memastikan label yang dihasilkan konsisten. Dataset dengan label yang tidak konsisten akan menurunkan akurasi model, sekalipun jumlah datanya besar. Skema label biner seperti yang dipakai pada QiscusCS, transferable atau tidak transferable, cenderung lebih mudah divalidasi konsistensinya dibanding skema label dengan banyak kategori.<\/p>\n\n\n\n<p>Proses empat tahap ini adalah gambaran umum. Bisnis yang ingin memahami lebih dalam bagaimana <a href=\"https:\/\/www.qiscus.com\/id\/blog\/cara-melatih-ai-agent\/\">cara melatih AI Agent<\/a> setelah dataset siap juga perlu mempertimbangkan langkah lanjutan di luar sekadar pengumpulan data.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Studi_Kasus_Bagaimana_Tim_AI_Qiscus_Membangun_Dataset_Chatbot_Sendiri\"><\/span>Studi Kasus, Bagaimana Tim AI Qiscus Membangun Dataset Chatbot Sendiri<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Tantangan membangun dataset bukan cerita abstrak. Tim AI Qiscus sendiri pernah mengalaminya secara langsung ketika meneliti proses handover dari chatbot ke agen manusia.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Alasan_Tim_Qiscus_Membangun_Dataset_Sendiri\"><\/span>1. Alasan Tim Qiscus Membangun Dataset Sendiri<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p><a href=\"https:\/\/ieeexplore.ieee.org\/document\/11644567\">Penelitian yang dipublikasikan tim AI Qiscus di IEEE<\/a> mencatat satu kendala penting. Dataset publik untuk tugas handover chatbot ke manusia yang merefleksikan pola percakapan customer service nyata memang belum tersedia. Tim akhirnya membangun dataset sendiri yang diberi nama QiscusCS, diambil dari data percakapan di platform customer engagement Qiscus.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Skala_dan_Proses_Anotasi_Dataset_QiscusCS\"><\/span>2. Skala dan Proses Anotasi Dataset QiscusCS<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Dataset QiscusCS terdiri dari 100 dialog yang mencakup lebih dari 4.000 utterance, tepatnya 4.265 utterance dengan rata rata 44,43 utterance per dialog. Setiap utterance dianotasi manual oleh tiga domain expert dari tim Customer Service Qiscus, dengan label biner transferable atau tidak transferable. Seluruh data identitas pelanggan diganti dengan data dummy sebelum dipakai, untuk menjaga privasi.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Struktur_Data_yang_Dipakai_Tim_Qiscus\"><\/span>3. Struktur Data yang Dipakai Tim Qiscus<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Setiap baris dalam dataset QiscusCS menyimpan enam kolom, yaitu nama pengguna, email pengguna, id ruang percakapan, isi pesan, peran pengirim, dan label transferable. Struktur sesederhana ini ternyata cukup untuk melatih model mendeteksi kapan sebuah percakapan perlu dieskalasi ke manusia.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"4_Dataset_Bagus_Saja_Tidak_Menjamin_Performa_Model\"><\/span>4. Dataset Bagus Saja Tidak Menjamin Performa Model<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Dataset QiscusCS yang sama dipakai untuk membandingkan dua arsitektur, Single-Agent dan Multi-Agent. Hasilnya arsitektur Multi-Agent dengan Gemini 2.5 Flash mencatat Macro F1-Score 0,6260. Angka itu jauh di atas arsitektur Single-Agent dengan model yang sama, yang hanya mencatat 0,3333. Dataset-nya identik, tapi performanya bisa berbeda hampir dua kali lipat tergantung arsitektur yang dipakai untuk mengolahnya.<\/p>\n\n\n\n<p>Temuan ini penting untuk tim yang berencana membangun dataset sendiri. Investasi waktu pada anotasi dataset yang rapi bisa jadi sia sia kalau arsitektur model di atasnya tidak dirancang dengan benar.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Apa_yang_Bisa_Dipelajari_dari_Perbandingan_Arsitektur_di_Studi_Kasus_Ini\"><\/span>Apa yang Bisa Dipelajari dari Perbandingan Arsitektur di Studi Kasus Ini<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Selisih performa antara Single-Agent dan Multi-Agent pada dataset yang sama memberi pelajaran konkret bagi tim yang sedang mempertimbangkan pendekatan <a href=\"https:\/\/www.qiscus.com\/id\/blog\/agentic-ai\/\">agentic AI<\/a> untuk kebutuhan mereka.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Model_Dasar_Kurang_Berpengaruh_pada_Sistem_Multi-Agent\"><\/span>1. Model Dasar Kurang Berpengaruh pada Sistem Multi-Agent<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Pada arsitektur Multi-Agent, model Gemini 2.5 Flash justru mencatat skor sedikit lebih tinggi dibanding GPT 4.1, meski secara umum dianggap model yang lebih ringan. Hasil ini menunjukkan bahwa desain arsitektur bisa lebih menentukan daripada sekadar memilih model dasar yang paling besar.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Model_Dasar_Sangat_Berpengaruh_pada_Sistem_Single-Agent\"><\/span>2. Model Dasar Sangat Berpengaruh pada Sistem Single-Agent<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Pada arsitektur Single-Agent, GPT 4.1 mencatat Macro F1-Score 0,5356, jauh di atas Gemini 2.5 Flash yang hanya 0,3333. Pada sistem yang lebih sederhana, kemampuan model dasar menjadi faktor yang jauh lebih menentukan.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Waktu_Eskalasi_Memengaruhi_Akurasi_pada_Kasus_Sulit\"><\/span>3. Waktu Eskalasi Memengaruhi Akurasi pada Kasus Sulit<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Model Single-Agent Gemini cenderung menahan percakapan terlalu lama sebelum eskalasi, bahkan kadang tidak eskalasi sama sekali. Pola ini menurunkan presisi pada kasus minoritas yang sebenarnya butuh penanganan ahli.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"4_Satu_Metrik_Saja_Tidak_Cukup_untuk_Menilai_Kualitas_Model\"><\/span>4. Satu Metrik Saja Tidak Cukup untuk Menilai Kualitas Model<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Menariknya, arsitektur Single-Agent OpenAI justru mencatat skor AUC tertinggi di antara keempat setup, yaitu 0,7017, meski Macro F1-Score nya kalah jauh dari Multi-Agent. AUC mengukur kemampuan model membedakan kelas di berbagai ambang batas, sementara Macro F1-Score mengukur keseimbangan presisi dan recall pada satu ambang batas tertentu. Tim yang hanya melihat satu metrik berisiko salah menyimpulkan model mana yang sebenarnya paling siap produksi.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Biaya_Tersembunyi_Membangun_Dataset_Chatbot_Sendiri\"><\/span>Biaya Tersembunyi Membangun Dataset Chatbot Sendiri<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Biaya membangun dataset chatbot jarang berhenti di jam kerja anotasi saja. Beberapa komponen berikut sering luput dari estimasi awal tim.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Waktu_Domain_Expert_yang_Ikut_Teralokasi_ke_Anotasi\"><\/span>1. Waktu Domain Expert yang Ikut Teralokasi ke Anotasi<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Studi kasus QiscusCS di atas melibatkan tiga domain expert dari tim Customer Service, bukan anotator umum yang bisa disewa lepas. Waktu domain expert yang biasanya menangani pekerjaan operasional harian ikut teralokasi untuk memberi label pada ribuan utterance.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Eksperimen_Arsitektur_yang_Butuh_Siklus_Trial_and_Error\"><\/span>2. Eksperimen Arsitektur yang Butuh Siklus Trial and Error<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Seperti terlihat dari perbandingan Single-Agent dan Multi-Agent di atas, satu dataset saja tidak cukup untuk memastikan hasil yang baik. Tim perlu menguji beberapa <a href=\"https:\/\/www.qiscus.com\/id\/blog\/tipe-ai-agent\/\">tipe AI Agent<\/a> dan model dasar sebelum menemukan kombinasi yang benar benar bekerja untuk kasus bisnis mereka.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Pemeliharaan_Dataset_yang_Berkelanjutan\"><\/span>3. Pemeliharaan Dataset yang Berkelanjutan<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Pola pertanyaan pelanggan berubah seiring waktu, terutama saat ada produk baru atau kebijakan baru. Dataset yang tidak diperbarui secara berkala akan membuat model semakin kurang relevan dengan percakapan nyata yang masuk setiap hari.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Pertimbangan_Kepatuhan_Data_Saat_Membangun_Dataset_Chatbot\"><\/span>Pertimbangan Kepatuhan Data Saat Membangun Dataset Chatbot<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Dataset chatbot yang dibangun dari log percakapan pelanggan nyata otomatis berisi data pribadi. Tim yang menyepelekan tahap kepatuhan data berisiko menghadapi masalah hukum, bukan cuma masalah teknis.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Anonimisasi_Bukan_Sekadar_Menghapus_Nama\"><\/span>1. Anonimisasi Bukan Sekadar Menghapus Nama<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Studi kasus QiscusCS menunjukkan pendekatan yang tepat, seluruh data identitas pelanggan diganti dengan data dummy sebelum dipakai untuk riset. Anonimisasi yang benar juga perlu mempertimbangkan kombinasi data yang secara tidak langsung bisa mengidentifikasi seseorang, bukan hanya nama dan email secara terpisah.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Kepatuhan_terhadap_Undang_Undang_Pelindungan_Data_Pribadi\"><\/span>2. Kepatuhan terhadap Undang Undang Pelindungan Data Pribadi<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Bisnis di Indonesia yang mengumpulkan data percakapan pelanggan untuk keperluan pelatihan model tetap tunduk pada UU Pelindungan Data Pribadi. Persetujuan penggunaan data untuk tujuan pelatihan AI sebaiknya dicantumkan secara eksplisit dalam kebijakan privasi, bukan diasumsikan otomatis termasuk dalam persetujuan layanan pelanggan biasa.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Akses_Terbatas_ke_Dataset_Mentah\"><\/span>3. Akses Terbatas ke Dataset Mentah<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Batasi akses ke dataset mentah hanya untuk anggota tim yang benar benar terlibat dalam anotasi dan pelatihan model. Semakin banyak orang yang bisa mengakses data mentah berisi percakapan pelanggan, semakin besar pula risiko kebocoran data.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Dataset_Chatbot_Sendiri_vs_AI_Agent_Siap_Pakai_Mana_yang_Lebih_Masuk_Akal\"><\/span>Dataset Chatbot Sendiri vs AI Agent Siap Pakai, Mana yang Lebih Masuk Akal<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Pertimbangan ini bukan soal mana yang lebih canggih secara teknis, melainkan soal alokasi waktu dan risiko yang bersedia ditanggung tim. Dua contoh berikut menunjukkan bagaimana pertimbangan ini berbeda tergantung skala bisnis.<\/p>\n\n\n\n<p>Bisnis e-commerce dengan volume ribuan percakapan per hari biasanya sudah punya cukup data mentah untuk membangun dataset sendiri. Masalahnya, bisnis semacam ini jarang punya tim data science internal untuk mengolah data itu. Bisnis skala menengah dengan volume lebih kecil biasanya menghadapi masalah sebaliknya. Data mentahnya belum cukup banyak untuk melatih model yang andal, sehingga opsi siap pakai jadi lebih masuk akal sejak awal.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th><strong>Aspek<\/strong><\/th><th><strong>Bangun Dataset Sendiri<\/strong><\/th><th><strong>AI Agent Siap Pakai<\/strong><\/th><\/tr><\/thead><tbody><tr><td>Waktu ke produksi<\/td><td>Berbulan bulan, termasuk anotasi dan eksperimen arsitektur<\/td><td>Hitungan minggu, tinggal konfigurasi knowledge base<\/td><\/tr><tr><td>Kebutuhan tim<\/td><td>Domain expert untuk anotasi, data engineer untuk eksperimen model<\/td><td>Tim CS atau IT yang mengelola knowledge base<\/td><\/tr><tr><td>Risiko performa<\/td><td>Bergantung pada kualitas dataset dan pilihan arsitektur<\/td><td>Arsitektur sudah diuji, tinggal disesuaikan konteks bisnis<\/td><\/tr><tr><td>Kontrol atas data<\/td><td>Penuh, data dan model sepenuhnya milik tim internal<\/td><td>Data pelanggan tetap dikelola dalam platform yang dipakai<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p>Kesimpulan praktis dari tabel di atas, membangun dataset sendiri masuk akal untuk tim riset yang memang butuh kontrol penuh atas model. Untuk kebutuhan bisnis yang mengejar waktu implementasi cepat, opsi siap pakai biasanya lebih realistis. Studi kasus QiscusCS di atas menunjukkan bahwa jalur riset ini nyata dan bisa ditempuh. Jalur ini juga menuntut sumber daya yang tidak semua bisnis punya, terutama dari sisi domain expert dan waktu eksperimen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Cara_AI_Agent_Siap_Pakai_Menghindarkan_Beban_Membangun_Dataset\"><\/span>Cara AI Agent Siap Pakai Menghindarkan Beban Membangun Dataset<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Bisnis yang tidak punya tim data science khusus tetap bisa mendapatkan AI Agent yang bekerja baik, tanpa melewati proses membangun dataset dari nol.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Knowledge_Base_Menggantikan_Kebutuhan_Dataset_Percakapan_Mentah\"><\/span>1. Knowledge Base Menggantikan Kebutuhan Dataset Percakapan Mentah<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p><a href=\"https:\/\/www.qiscus.com\/id\/agentlabs\">AI Agent siap pakai tanpa perlu membangun dataset sendiri<\/a> bekerja dengan basis knowledge base yang diisi dari dokumen dan FAQ bisnis. Sumber datanya bukan ribuan utterance yang perlu dianotasi manual. Tim cukup mengisi materi yang sudah ada, bukan membangun dataset percakapan dari nol. Beberapa platform bahkan menyediakan <a href=\"https:\/\/www.qiscus.com\/id\/blog\/template-ai-agent\/\">template AI Agent<\/a> siap pakai untuk mempercepat tahap awal ini.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Arsitektur_Sudah_Teruji_Tim_Tidak_Perlu_Eksperimen_Sendiri\"><\/span>2. Arsitektur Sudah Teruji, Tim Tidak Perlu Eksperimen Sendiri<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Studi kasus QiscusCS di atas menunjukkan betapa besarnya selisih performa antar arsitektur. Memakai AI Agent yang arsitekturnya sudah melalui pengujian internal berarti tim bisnis tidak perlu mengulang siklus eksperimen itu dari awal.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Fokus_Tim_Bergeser_ke_Konteks_Bisnis_Bukan_Rekayasa_Model\"><\/span>3. Fokus Tim Bergeser ke Konteks Bisnis, Bukan Rekayasa Model<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Tanpa beban membangun dan memelihara dataset, tim IT dan CS bisa fokus menyempurnakan knowledge base dan alur eskalasi sesuai kebutuhan bisnis. Ini area yang jauh lebih dekat dengan keahlian mereka dibanding rekayasa model machine learning. Memantau <a href=\"https:\/\/www.qiscus.com\/id\/blog\/kpi-ai-agent\/\">KPI AI Agent<\/a> yang relevan menjadi pekerjaan utama tim, bukan lagi menyusun ulang dataset setiap kali performa menurun.<\/p>\n\n\n\n<p><a href=\"https:\/\/www.qiscus.com\/id\/blog\/pcs-transformasi-ai-pengambil-keputusan\/\">PCS berhasil bertransformasi dari sekadar auto-responder menjadi AI yang bisa mengambil keputusan<\/a> setelah beralih dari pendekatan bot sederhana ke AI Agent yang lebih matang. Transformasi ini terjadi tanpa perlu membangun tim data science internal untuk mencapainya.<\/p>\n\n\n\n<p>Pendekatan ini juga relevan untuk tim yang sedang mengevaluasi <a href=\"https:\/\/www.qiscus.com\/id\/blog\/tantangan-implementasi-ai-agent\/\">tantangan implementasi AI Agent<\/a> secara lebih luas. Kebutuhan dataset sering jadi salah satu hambatan terbesar yang tidak disadari sejak awal proyek.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Cara_Memulai_Baik_Membangun_Sendiri_Maupun_Evaluasi_AI_Agent_Siap_Pakai\"><\/span>Cara Memulai, Baik Membangun Sendiri Maupun Evaluasi AI Agent Siap Pakai<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Langkah berikut membantu tim menentukan arah yang paling realistis sesuai kapasitas yang tersedia.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"1_Audit_Kapasitas_Tim_Data_Science_Internal\"><\/span>1. Audit Kapasitas Tim Data Science Internal<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Petakan apakah tim internal punya kapasitas untuk anotasi manual, eksperimen arsitektur, dan pemeliharaan dataset jangka panjang. Kekurangan kapasitas di salah satu area ini biasanya jadi sinyal kuat untuk mempertimbangkan opsi siap pakai. Kalau kapasitas dinilai belum cukup, <a href=\"https:\/\/www.qiscus.com\/id\/blog\/cara-memilih-ai-agent\/\">kriteria memilih AI Agent<\/a> yang tepat menjadi langkah lanjutan yang perlu dipertimbangkan.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"2_Petakan_Volume_dan_Jenis_Percakapan_yang_Perlu_Ditangani\"><\/span>2. Petakan Volume dan Jenis Percakapan yang Perlu Ditangani<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Hitung perkiraan volume percakapan harian dan jenis pertanyaan yang paling sering masuk. Data ini berguna baik untuk merancang dataset sendiri maupun untuk mengisi knowledge base AI Agent siap pakai.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"3_Bandingkan_Estimasi_Waktu_ke_Produksi\"><\/span>3. Bandingkan Estimasi Waktu ke Produksi<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Bandingkan estimasi waktu membangun dataset dan menguji arsitektur sendiri dengan waktu implementasi AI Agent siap pakai. Perbedaan waktu ke produksi sering jadi faktor penentu, terutama untuk bisnis yang sudah merasakan dampak operasional dari CS yang kewalahan. Sebagai gambaran kasar, proses anotasi manual untuk seratus dialog saja pada studi kasus QiscusCS melibatkan tiga orang secara paralel. Bisnis yang membutuhkan dataset dengan cakupan topik lebih luas perlu memperhitungkan waktu anotasi yang bertambah proporsional dengan jumlah dialog dan variasi topiknya.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"4_Mulai_dari_Skala_Kecil_Sebelum_Komitmen_Penuh\"><\/span>4. Mulai dari Skala Kecil Sebelum Komitmen Penuh<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Baik membangun dataset sendiri maupun mengadopsi AI Agent siap pakai, mulai dari cakupan topik yang terbatas sebelum memperluas ke seluruh alur percakapan. Skala kecil memudahkan evaluasi hasil sebelum sumber daya besar dikomit.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"5_Tinjau_Ulang_Keputusan_Setiap_Beberapa_Bulan\"><\/span>5. Tinjau Ulang Keputusan Setiap Beberapa Bulan<span class=\"ez-toc-section-end\"><\/span><\/h3>\n\n\n\n<p>Kebutuhan bisnis dan volume percakapan bisa berubah, sehingga keputusan build atau buy di awal tidak harus bersifat permanen. Peninjauan berkala membantu tim menyesuaikan strategi begitu ada perubahan skala atau kompleksitas kebutuhan. Ini juga berlaku untuk tim yang berencana <a href=\"https:\/\/www.qiscus.com\/id\/blog\/implementasi-ai-agent\/\">implementasi AI Agent<\/a> secara bertahap, bukan sekaligus di seluruh kanal.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Dataset_Bukan_Segalanya_Eksekusi_yang_Menentukan_Hasil\"><\/span>Dataset Bukan Segalanya, Eksekusi yang Menentukan Hasil<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p>Studi kasus QiscusCS membuktikan satu hal penting. Dataset yang dianotasi dengan baik hanyalah titik awal, bukan jaminan hasil. Arsitektur yang mengolah dataset tersebut, dan konsistensi pemeliharaannya dari waktu ke waktu, sama pentingnya dengan kualitas data itu sendiri. Bisnis yang memahami ketiga faktor ini sejak awal akan lebih siap membuat keputusan build atau buy yang realistis.<\/p>\n\n\n\n<p>Tim yang punya kapasitas riset internal bisa mendapat banyak manfaat dari membangun dataset sendiri. Tim yang mengejar waktu implementasi cepat biasanya lebih diuntungkan oleh AI Agent yang arsitekturnya sudah teruji sejak awal.<\/p>\n\n\n\n<p>Jelajahi solusi customer engagement dari <a href=\"https:\/\/www.qiscus.com\/id\">Qiscus<\/a> untuk melihat bagaimana AI Agent bisa berjalan tanpa membebani tim dengan proyek dataset dari nol. Performanya juga sudah teruji sejak awal, bukan hasil eksperimen internal yang belum pasti.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Pertanyaan_yang_Sering_Ditanyakan_tentang_Dataset_Chatbot\"><\/span>Pertanyaan yang Sering Ditanyakan tentang Dataset Chatbot<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<div class=\"schema-faq wp-block-yoast-faq-block\"><div class=\"schema-faq-section\" id=\"faq-question-1787809675640\"><strong class=\"schema-faq-question\">Apa itu dataset chatbot?<\/strong> <p class=\"schema-faq-answer\">Dataset chatbot adalah kumpulan data percakapan, pasangan tanya jawab, atau dialog berlabel yang dipakai untuk melatih dan menguji model AI percakapan. Kualitas dan relevansi dataset ini langsung memengaruhi seberapa baik model memahami konteks penggunanya.<\/p> <\/div> <div class=\"schema-faq-section\" id=\"faq-question-1787809684991\"><strong class=\"schema-faq-question\">Di mana bisa mendapatkan dataset chatbot?<\/strong> <p class=\"schema-faq-answer\">Dataset chatbot bisa didapat dari repositori publik seperti Kaggle atau GitHub untuk kasus umum, atau dibangun sendiri dari log percakapan internal untuk kasus bisnis yang spesifik. Dataset publik biasanya kurang merepresentasikan konteks bisnis tertentu dibanding dataset yang dibangun langsung dari data percakapan asli perusahaan sendiri.<\/p> <\/div> <div class=\"schema-faq-section\" id=\"faq-question-1787809696767\"><strong class=\"schema-faq-question\">Berapa banyak data yang dibutuhkan untuk melatih chatbot yang baik?<\/strong> <p class=\"schema-faq-answer\">Tidak ada angka pasti yang berlaku universal, karena kebutuhan volume data bergantung pada kompleksitas kasus yang ingin ditangani. Studi kasus QiscusCS misalnya memakai 100 dialog dengan lebih dari 4.000 utterance untuk riset perbandingan arsitektur, bukan untuk melatih model dari nol.<\/p> <\/div> <div class=\"schema-faq-section\" id=\"faq-question-1787809709011\"><strong class=\"schema-faq-question\">Apakah dataset yang besar selalu menghasilkan chatbot yang lebih baik?<\/strong> <p class=\"schema-faq-answer\">Tidak selalu. Studi kasus QiscusCS menunjukkan dua arsitektur yang memakai dataset identik bisa menghasilkan performa yang sangat berbeda. Selisihnya hampir dua kali lipat pada Macro F1-Score. Arsitektur pengolahan data sama pentingnya dengan volume dataset itu sendiri.<\/p> <\/div> <div class=\"schema-faq-section\" id=\"faq-question-1787809722125\"><strong class=\"schema-faq-question\">Kapan sebaiknya bisnis memilih AI Agent siap pakai dibanding membangun dataset sendiri?<\/strong> <p class=\"schema-faq-answer\">Bisnis yang tidak punya tim data science internal atau butuh waktu implementasi cepat biasanya lebih diuntungkan oleh AI Agent siap pakai. Membangun dataset sendiri lebih masuk akal untuk tim riset yang memang membutuhkan kontrol penuh atas data dan model.<\/p> <\/div> <\/div>\n","protected":false},"excerpt":{"rendered":"Tim IT yang mau membangun chatbot sendiri biasanya berhenti di satu pertanyaan, dari mana dataset chatbot yang layak&hellip;\n","protected":false},"author":20,"featured_media":12779,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_monsterinsights_skip_tracking":false,"_monsterinsights_sitenote_active":false,"_monsterinsights_sitenote_note":"","_monsterinsights_sitenote_category":0,"footnotes":""},"categories":[3,2360],"tags":[2017],"class_list":{"0":"post-12778","1":"post","2":"type-post","3":"status-publish","4":"format-standard","5":"has-post-thumbnail","7":"category-insight","8":"category-research","9":"tag-ai-agent"},"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v28.2 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data<\/title>\n<meta name=\"description\" content=\"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/\" \/>\n<meta property=\"og:locale\" content=\"en_US\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data\" \/>\n<meta property=\"og:description\" content=\"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.\" \/>\n<meta property=\"og:url\" content=\"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/\" \/>\n<meta property=\"og:site_name\" content=\"Omnichannel Conversational Platform\" \/>\n<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/Qiscus\" \/>\n<meta property=\"article:published_time\" content=\"2026-08-27T05:49:04+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2026-08-27T05:49:06+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp\" \/>\n\t<meta property=\"og:image:width\" content=\"981\" \/>\n\t<meta property=\"og:image:height\" content=\"631\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/webp\" \/>\n<meta name=\"author\" content=\"Bima Sandria\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:creator\" content=\"@qiscus_io\" \/>\n<meta name=\"twitter:site\" content=\"@qiscus_io\" \/>\n<meta name=\"twitter:label1\" content=\"Written by\" \/>\n\t<meta name=\"twitter:data1\" content=\"Bima Sandria\" \/>\n\t<meta name=\"twitter:label2\" content=\"Est. reading time\" \/>\n\t<meta name=\"twitter:data2\" content=\"12 minutes\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/\"},\"author\":{\"name\":\"Bima Sandria\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/#\\\/schema\\\/person\\\/2d8ae42e5e88ae80e96354eababd5938\"},\"headline\":\"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data\",\"datePublished\":\"2026-08-27T05:49:04+00:00\",\"dateModified\":\"2026-08-27T05:49:06+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/\"},\"wordCount\":2643,\"commentCount\":0,\"image\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/wp-content\\\/uploads\\\/sites\\\/2\\\/2026\\\/08\\\/dataset-chatbot_composed.webp\",\"keywords\":[\"AI Agent\"],\"articleSection\":[\"Insight\",\"Research\"],\"inLanguage\":\"en-US\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#respond\"]}]},{\"@type\":[\"WebPage\",\"FAQPage\"],\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/\",\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/\",\"name\":\"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/wp-content\\\/uploads\\\/sites\\\/2\\\/2026\\\/08\\\/dataset-chatbot_composed.webp\",\"datePublished\":\"2026-08-27T05:49:04+00:00\",\"dateModified\":\"2026-08-27T05:49:06+00:00\",\"author\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/#\\\/schema\\\/person\\\/2d8ae42e5e88ae80e96354eababd5938\"},\"description\":\"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#breadcrumb\"},\"mainEntity\":[{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809675640\"},{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809684991\"},{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809696767\"},{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809709011\"},{\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809722125\"}],\"inLanguage\":\"en-US\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"en-US\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#primaryimage\",\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/wp-content\\\/uploads\\\/sites\\\/2\\\/2026\\\/08\\\/dataset-chatbot_composed.webp\",\"contentUrl\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/wp-content\\\/uploads\\\/sites\\\/2\\\/2026\\\/08\\\/dataset-chatbot_composed.webp\",\"width\":981,\"height\":631,\"caption\":\"Dataset chatbot.\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Research\",\"item\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/category\\\/research\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/#website\",\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/\",\"name\":\"Omnichannel Conversational Platform\",\"description\":\"Artikel bagi Perusahaan untuk memajukan Customer Experience\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"en-US\"},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/#\\\/schema\\\/person\\\/2d8ae42e5e88ae80e96354eababd5938\",\"name\":\"Bima Sandria\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"en-US\",\"@id\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g\",\"contentUrl\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g\",\"caption\":\"Bima Sandria\"},\"sameAs\":[\"https:\\\/\\\/www.instagram.com\\\/bimasandriaa\\\/\",\"https:\\\/\\\/id.linkedin.com\\\/in\\\/bimasandriaa\",\"https:\\\/\\\/id.pinterest.com\\\/argasona\\\/\"],\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/author\\\/bima\\\/\"},{\"@type\":\"Question\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809675640\",\"position\":1,\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809675640\",\"name\":\"Apa itu dataset chatbot?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Dataset chatbot adalah kumpulan data percakapan, pasangan tanya jawab, atau dialog berlabel yang dipakai untuk melatih dan menguji model AI percakapan. Kualitas dan relevansi dataset ini langsung memengaruhi seberapa baik model memahami konteks penggunanya.\",\"inLanguage\":\"en-US\"},\"inLanguage\":\"en-US\"},{\"@type\":\"Question\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809684991\",\"position\":2,\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809684991\",\"name\":\"Di mana bisa mendapatkan dataset chatbot?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Dataset chatbot bisa didapat dari repositori publik seperti Kaggle atau GitHub untuk kasus umum, atau dibangun sendiri dari log percakapan internal untuk kasus bisnis yang spesifik. Dataset publik biasanya kurang merepresentasikan konteks bisnis tertentu dibanding dataset yang dibangun langsung dari data percakapan asli perusahaan sendiri.\",\"inLanguage\":\"en-US\"},\"inLanguage\":\"en-US\"},{\"@type\":\"Question\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809696767\",\"position\":3,\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809696767\",\"name\":\"Berapa banyak data yang dibutuhkan untuk melatih chatbot yang baik?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Tidak ada angka pasti yang berlaku universal, karena kebutuhan volume data bergantung pada kompleksitas kasus yang ingin ditangani. Studi kasus QiscusCS misalnya memakai 100 dialog dengan lebih dari 4.000 utterance untuk riset perbandingan arsitektur, bukan untuk melatih model dari nol.\",\"inLanguage\":\"en-US\"},\"inLanguage\":\"en-US\"},{\"@type\":\"Question\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809709011\",\"position\":4,\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809709011\",\"name\":\"Apakah dataset yang besar selalu menghasilkan chatbot yang lebih baik?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Tidak selalu. Studi kasus QiscusCS menunjukkan dua arsitektur yang memakai dataset identik bisa menghasilkan performa yang sangat berbeda. Selisihnya hampir dua kali lipat pada Macro F1-Score. Arsitektur pengolahan data sama pentingnya dengan volume dataset itu sendiri.\",\"inLanguage\":\"en-US\"},\"inLanguage\":\"en-US\"},{\"@type\":\"Question\",\"@id\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809722125\",\"position\":5,\"url\":\"https:\\\/\\\/www.qiscus.com\\\/id\\\/blog\\\/dataset-chatbot\\\/#faq-question-1787809722125\",\"name\":\"Kapan sebaiknya bisnis memilih AI Agent siap pakai dibanding membangun dataset sendiri?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"Bisnis yang tidak punya tim data science internal atau butuh waktu implementasi cepat biasanya lebih diuntungkan oleh AI Agent siap pakai. Membangun dataset sendiri lebih masuk akal untuk tim riset yang memang membutuhkan kontrol penuh atas data dan model.\",\"inLanguage\":\"en-US\"},\"inLanguage\":\"en-US\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data","description":"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/","og_locale":"en_US","og_type":"article","og_title":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data","og_description":"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.","og_url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/","og_site_name":"Omnichannel Conversational Platform","article_publisher":"https:\/\/www.facebook.com\/Qiscus","article_published_time":"2026-08-27T05:49:04+00:00","article_modified_time":"2026-08-27T05:49:06+00:00","og_image":[{"width":981,"height":631,"url":"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp","type":"image\/webp"}],"author":"Bima Sandria","twitter_card":"summary_large_image","twitter_creator":"@qiscus_io","twitter_site":"@qiscus_io","twitter_misc":{"Written by":"Bima Sandria","Est. reading time":"12 minutes"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#article","isPartOf":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/"},"author":{"name":"Bima Sandria","@id":"https:\/\/www.qiscus.com\/id\/#\/schema\/person\/2d8ae42e5e88ae80e96354eababd5938"},"headline":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data","datePublished":"2026-08-27T05:49:04+00:00","dateModified":"2026-08-27T05:49:06+00:00","mainEntityOfPage":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/"},"wordCount":2643,"commentCount":0,"image":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#primaryimage"},"thumbnailUrl":"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp","keywords":["AI Agent"],"articleSection":["Insight","Research"],"inLanguage":"en-US","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#respond"]}]},{"@type":["WebPage","FAQPage"],"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/","url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/","name":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data","isPartOf":{"@id":"https:\/\/www.qiscus.com\/id\/#website"},"primaryImageOfPage":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#primaryimage"},"image":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#primaryimage"},"thumbnailUrl":"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp","datePublished":"2026-08-27T05:49:04+00:00","dateModified":"2026-08-27T05:49:06+00:00","author":{"@id":"https:\/\/www.qiscus.com\/id\/#\/schema\/person\/2d8ae42e5e88ae80e96354eababd5938"},"description":"Pelajari jenis dataset chatbot, cara membangunnya sendiri, studi kasus dataset QiscusCS dari tim AI Qiscus.","breadcrumb":{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#breadcrumb"},"mainEntity":[{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809675640"},{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809684991"},{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809696767"},{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809709011"},{"@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809722125"}],"inLanguage":"en-US","potentialAction":[{"@type":"ReadAction","target":["https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/"]}]},{"@type":"ImageObject","inLanguage":"en-US","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#primaryimage","url":"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp","contentUrl":"https:\/\/www.qiscus.com\/id\/wp-content\/uploads\/sites\/2\/2026\/08\/dataset-chatbot_composed.webp","width":981,"height":631,"caption":"Dataset chatbot."},{"@type":"BreadcrumbList","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Research","item":"https:\/\/www.qiscus.com\/id\/blog\/category\/research\/"},{"@type":"ListItem","position":2,"name":"Dataset Chatbot: Dari Riset Arsitektur Hingga Kepatuhan Data"}]},{"@type":"WebSite","@id":"https:\/\/www.qiscus.com\/id\/#website","url":"https:\/\/www.qiscus.com\/id\/","name":"Omnichannel Conversational Platform","description":"Artikel bagi Perusahaan untuk memajukan Customer Experience","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/www.qiscus.com\/id\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"en-US"},{"@type":"Person","@id":"https:\/\/www.qiscus.com\/id\/#\/schema\/person\/2d8ae42e5e88ae80e96354eababd5938","name":"Bima Sandria","image":{"@type":"ImageObject","inLanguage":"en-US","@id":"https:\/\/secure.gravatar.com\/avatar\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g","url":"https:\/\/secure.gravatar.com\/avatar\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/2ec689cf394ed58502e8e73391b51b1dff0bc778a4194a011fa9e61444903888?s=96&d=mm&r=g","caption":"Bima Sandria"},"sameAs":["https:\/\/www.instagram.com\/bimasandriaa\/","https:\/\/id.linkedin.com\/in\/bimasandriaa","https:\/\/id.pinterest.com\/argasona\/"],"url":"https:\/\/www.qiscus.com\/id\/blog\/author\/bima\/"},{"@type":"Question","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809675640","position":1,"url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809675640","name":"Apa itu dataset chatbot?","answerCount":1,"acceptedAnswer":{"@type":"Answer","text":"Dataset chatbot adalah kumpulan data percakapan, pasangan tanya jawab, atau dialog berlabel yang dipakai untuk melatih dan menguji model AI percakapan. Kualitas dan relevansi dataset ini langsung memengaruhi seberapa baik model memahami konteks penggunanya.","inLanguage":"en-US"},"inLanguage":"en-US"},{"@type":"Question","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809684991","position":2,"url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809684991","name":"Di mana bisa mendapatkan dataset chatbot?","answerCount":1,"acceptedAnswer":{"@type":"Answer","text":"Dataset chatbot bisa didapat dari repositori publik seperti Kaggle atau GitHub untuk kasus umum, atau dibangun sendiri dari log percakapan internal untuk kasus bisnis yang spesifik. Dataset publik biasanya kurang merepresentasikan konteks bisnis tertentu dibanding dataset yang dibangun langsung dari data percakapan asli perusahaan sendiri.","inLanguage":"en-US"},"inLanguage":"en-US"},{"@type":"Question","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809696767","position":3,"url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809696767","name":"Berapa banyak data yang dibutuhkan untuk melatih chatbot yang baik?","answerCount":1,"acceptedAnswer":{"@type":"Answer","text":"Tidak ada angka pasti yang berlaku universal, karena kebutuhan volume data bergantung pada kompleksitas kasus yang ingin ditangani. Studi kasus QiscusCS misalnya memakai 100 dialog dengan lebih dari 4.000 utterance untuk riset perbandingan arsitektur, bukan untuk melatih model dari nol.","inLanguage":"en-US"},"inLanguage":"en-US"},{"@type":"Question","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809709011","position":4,"url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809709011","name":"Apakah dataset yang besar selalu menghasilkan chatbot yang lebih baik?","answerCount":1,"acceptedAnswer":{"@type":"Answer","text":"Tidak selalu. Studi kasus QiscusCS menunjukkan dua arsitektur yang memakai dataset identik bisa menghasilkan performa yang sangat berbeda. Selisihnya hampir dua kali lipat pada Macro F1-Score. Arsitektur pengolahan data sama pentingnya dengan volume dataset itu sendiri.","inLanguage":"en-US"},"inLanguage":"en-US"},{"@type":"Question","@id":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809722125","position":5,"url":"https:\/\/www.qiscus.com\/id\/blog\/dataset-chatbot\/#faq-question-1787809722125","name":"Kapan sebaiknya bisnis memilih AI Agent siap pakai dibanding membangun dataset sendiri?","answerCount":1,"acceptedAnswer":{"@type":"Answer","text":"Bisnis yang tidak punya tim data science internal atau butuh waktu implementasi cepat biasanya lebih diuntungkan oleh AI Agent siap pakai. Membangun dataset sendiri lebih masuk akal untuk tim riset yang memang membutuhkan kontrol penuh atas data dan model.","inLanguage":"en-US"},"inLanguage":"en-US"}]}},"_links":{"self":[{"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/posts\/12778","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/users\/20"}],"replies":[{"embeddable":true,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/comments?post=12778"}],"version-history":[{"count":1,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/posts\/12778\/revisions"}],"predecessor-version":[{"id":12780,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/posts\/12778\/revisions\/12780"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/media\/12779"}],"wp:attachment":[{"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/media?parent=12778"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/categories?post=12778"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.qiscus.com\/id\/wp-json\/wp\/v2\/tags?post=12778"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}