Setiap model AI punya batas panjang keluaran untuk satu kali respons, terlepas dari seberapa panjang percakapan yang sudah berjalan sebelumnya. Ini berbeda dari masalah context window, yang soal seberapa banyak percakapan lama yang masih diingat model. Token limit output adalah soal seberapa panjang satu jawaban tunggal boleh dihasilkan sebelum dipotong paksa.
Kapan masalah ini muncul
Biasanya muncul saat agent diminta menjelaskan sesuatu yang panjang, misalnya daftar lengkap paket layanan dengan detail masing-masing, atau ringkasan riwayat pesanan yang panjang. Kalau batas token output terlalu rendah untuk kebutuhan semacam itu, jawaban bisa berhenti tiba-tiba di tengah kalimat, kadang bahkan di tengah kata.
Kenapa ini merusak kepercayaan lebih dari sekadar terlihat aneh
Jawaban yang terpotong bukan cuma kelihatan tidak profesional, tapi bisa membuat pelanggan salah paham menerima informasi yang tidak lengkap sebagai jawaban final. Kalau daftar harga terpotong sebelum item terakhir, pelanggan bisa mengira itu daftar lengkap padahal bukan.
Cara menghindarinya
- Set batas token output cukup longgar untuk jenis pertanyaan yang jawabannya memang panjang
- Untuk daftar panjang, pecah menjadi beberapa pesan berurutan alih-alih satu blok teks raksasa
- Deteksi tanda-tanda respons terpotong (kalimat tidak selesai, tidak ada tanda baca penutup) dan otomatis lanjutkan generate bagian berikutnya
- Untuk kebutuhan yang benar-benar panjang, pertimbangkan mengirim ringkasan lewat chat dan link dokumen lengkap terpisah
Masalah ini kelihatan kecil, tapi termasuk kategori bug yang mudah terlewat saat testing karena biasanya baru muncul saat pertanyaan pelanggan asli lebih kompleks dari skenario uji yang dipakai tim internal.