Artikel lain di blog ini pernah membahas A/B testing untuk menguji perubahan instruksi prompt sebelum rollout penuh. Tapi ada kategori keputusan desain lain yang jarang dianggap layak diuji secara formal, padahal dampaknya ke pengalaman pelanggan bisa sama besarnya: seberapa panjang jawaban agent, dan seberapa cepat balasan itu muncul.
Kenapa dua hal ini sering diputuskan berdasarkan intuisi saja
Panjang respons dan kecepatan balas biasanya ditentukan sekali di awal pengembangan, lalu jarang dievaluasi ulang secara sistematis. Tim cenderung berasumsi “jawaban singkat pasti lebih disukai” atau “makin cepat makin baik” tanpa benar-benar mengukur apakah asumsi itu terbukti pada pelanggan nyata. Padahal preferensi ini bisa berbeda jauh tergantung jenis bisnis — pelanggan yang bertanya soal produk teknis mungkin justru menghargai jawaban yang cukup detail, sementara pelanggan yang tanya jam buka toko ingin jawaban singkat secepat mungkin.
Merancang eksperimen sederhana
Tidak perlu infrastruktur rumit untuk mulai menguji ini. Cara paling sederhana: bagi pelanggan yang bertanya hal serupa ke dua varian respons — satu versi ringkas (satu-dua kalimat), satu versi lebih lengkap dengan konteks tambahan — lalu amati indikator sederhana seperti apakah pelanggan bertanya lagi untuk klarifikasi (tanda jawaban kurang jelas) atau justru berhenti merespons setelah menerima jawaban terlalu panjang.
Untuk kecepatan balas, variabelnya sedikit berbeda: kadang jeda beberapa detik justru terasa lebih “manusiawi” dibanding balasan instan yang terasa seperti robot murni. Tapi jeda yang terlalu lama untuk pertanyaan sederhana bisa membuat pelanggan mengira pesan mereka tidak terkirim. Titik keseimbangan ini sebaiknya diuji, bukan ditebak.
Metrik yang lebih jujur daripada sekadar “kelihatan bagus”
Godaan terbesar saat menguji hal semacam ini adalah menilai dari selera pribadi tim — “menurut saya jawaban ini enak dibaca”. Metrik yang lebih dapat diandalkan justru perilaku pelanggan sesudahnya: apakah mereka lanjut menyelesaikan transaksi, apakah mereka bertanya ulang karena bingung, atau apakah mereka beralih ke kanal lain (telepon, datang langsung) karena merasa chat kurang membantu. Data semacam ini butuh waktu untuk terkumpul, jadi eksperimen desain seperti ini sebaiknya dijalankan cukup lama sebelum ditarik kesimpulan, bukan diputuskan dari beberapa percakapan saja.