Ada pola yang berulang dalam pekerjaan kami: sebuah tugas otomatis yang biasanya mulus tiba-tiba gagal, lalu naluri pertama adalah memeriksa datanya. Format salah? Ada angka aneh? Kolom hilang?
Apa yang sebenarnya terjadi
Dalam satu kasus, sebuah tugas rutin pengolahan data gagal. Waktu sudah terbuang untuk menelusuri isi data, padahal masalahnya jauh lebih mendasar: layanan pengirim pesan yang menjadi bagian dari alur tugas itu sedang tidak berjalan. Datanya sendiri baik-baik saja.
Ketika layanan seperti itu mati, efeknya merambat. Tugas yang bergantung padanya ikut gagal, dan pesan error yang muncul tidak selalu jelas menunjuk ke akar masalah.
Urutan pengecekan yang sekarang kami pakai
- Apakah layanan pendukungnya hidup? Server, penjadwal, dan layanan pengirim pesan.
- Apakah ada kejadian sistem baru-baru ini? Misalnya mesin yang baru dihidupkan ulang, karena beberapa layanan tidak otomatis menyala kembali.
- Baru setelah itu, apakah datanya bermasalah?
Kenapa urutan ini penting
Memeriksa dari lapisan paling bawah ke atas biasanya lebih cepat. Selain itu, menyalahkan data terlalu dini bisa membuat kita mengubah sesuatu yang sebenarnya tidak rusak.
Bagi bisnis yang memakai agent, ini berarti satu hal: pantau layanan di balik agent, bukan hanya agent-nya. Daftar layanan yang perlu hidup, dan siapa yang mengecek setelah pemadaman atau restart, sebaiknya ditulis jelas sejak awal.