Data Uji Sintetis vs Percakapan Asli Pelanggan Saat Menyiapkan AI Agent

Sebelum sebuah AI agent go-live, tim biasanya menjalankan serangkaian uji coba — dari checklist QA pre-launch sampai red-teaming yang mencoba membuat agent gagal secara sengaja. Tapi ada satu pertanyaan mendasar yang sering terlewat di tahap ini: dari mana pertanyaan uji coba itu berasal? Dikarang sendiri oleh tim, atau diambil dari percakapan pelanggan asli?

Godaan memakai data sintetis

Data sintetis — pertanyaan yang dikarang tim sendiri untuk menguji agent — punya daya tarik jelas: cepat dibuat, bisa disesuaikan untuk menguji skenario spesifik, dan tidak butuh izin akses ke data pelanggan yang sensitif. Masalahnya, pertanyaan yang dikarang tim cenderung rapi dan terstruktur, sementara pelanggan asli sering bertanya dengan cara yang jauh lebih berantakan — typo, singkatan yang tidak baku, atau beberapa pertanyaan digabung dalam satu pesan panjang tanpa tanda baca yang jelas.

Agent yang lulus semua uji dengan data sintetis bisa saja tetap kesulitan begitu dihadapkan dengan cara bicara pelanggan sungguhan, karena pola kalimat yang diuji tidak pernah benar-benar merepresentasikan cara orang mengetik di keadaan terburu-buru atau emosional.

Kapan data asli benar-benar diperlukan

Kalau bisnis sudah punya riwayat percakapan dari kanal lain — chat manual dengan admin, email pelanggan, atau bahkan komentar di media sosial — data ini jauh lebih berharga untuk uji coba dibanding pertanyaan karangan tim, karena mencerminkan bahasa dan pola pertanyaan yang benar-benar dipakai pelanggan. Data ini perlu dianonimkan dulu (hilangkan nama, nomor telepon, alamat spesifik) sebelum dipakai untuk pengujian, supaya tidak melanggar privasi pelanggan yang percakapannya diambil.

Untuk bisnis yang benar-benar baru dan belum punya riwayat percakapan sama sekali, data sintetis tetap jadi satu-satunya pilihan realistis di awal — tapi sebaiknya diperlakukan sebagai uji coba tahap pertama, bukan tahap terakhir. Begitu agent mulai melayani pelanggan sungguhan, percakapan riil yang terkumpul di minggu-minggu pertama sebaiknya ditinjau ulang untuk memperbaiki celah yang tidak terlihat saat masih memakai data karangan.

Kombinasi yang paling realistis

Pendekatan yang paling seimbang biasanya bukan memilih salah satu, tapi memakai keduanya untuk tujuan berbeda: data sintetis untuk menguji skenario ekstrem yang jarang terjadi tapi penting diantisipasi (percobaan manipulasi, pertanyaan di luar scope), dan data asli untuk memvalidasi bahwa percakapan sehari-hari yang paling umum benar-benar tertangani dengan baik.

Leave a Comment