Mengevaluasi prompt AI bukan hanya memilih jawaban yang terdengar pintar. Jika prompt dipakai untuk ringkasan, klasifikasi, atau ekstraksi data, uji apakah hasilnya tetap masuk akal ketika input berubah. Tutorial ini memakai dataset kecil agar bisa langsung dipraktikkan.
Alurnya: simpan contoh input, tetapkan output acuan, jalankan prompt, beri nilai dengan rubrik yang sama, lalu perbaiki satu hal dalam satu siklus. Dengan begitu, kamu bisa membedakan prompt yang benar-benar membaik dari prompt yang hanya kebetulan menghasilkan satu jawaban bagus.
Tentukan tugas dan kriteria sukses
Pilih tugas sempit, misalnya mengelompokkan pesan menjadi stok, pengiriman, atau lainnya. Tulis aturan sebelum melihat hasil: label harus berasal dari daftar, alasan maksimal satu kalimat, dan kasus ambigu ditandai untuk review. Kriteria ini menjadi rubrik yang konsisten.
Buat dataset kecil yang beragam
Mulai dengan 10 sampai 20 contoh aman. Campurkan input normal, typo, kalimat pendek, bahasa campuran, informasi kosong, dan contoh yang seharusnya ditolak. Tulis jawaban acuan untuk setiap input. Jangan memasukkan password, token, data pelanggan, atau informasi rahasia. Dataset kecil memberi sinyal awal, tetapi bukan pengganti pengujian luas.
Susun prompt dan workflow evaluasi
Pisahkan konteks, tugas, batasan, dan format output. Minta model tidak menebak serta mengembalikan field stabil. Simpan prompt versi 1, jalankan semua contoh, parse output, validasi schema, beri skor, lalu kelompokkan kegagalan. Ubah satu bagian saja dan jalankan dataset yang sama lagi. Catat accuracy, format pass rate, groundedness, ambiguity recall, latency, biaya, dan error provider.
- Accuracy: jawaban sesuai acuan.
- Format: output dapat diparse dan field wajib tersedia.
- Groundedness: klaim berasal dari input atau sumber yang diizinkan.
- Stability: hasil tetap masuk akal pada pengulangan.
Untuk latihan workflow data bisnis, Aplikasi Kasir - Simpel-POS dapat menjadi contoh domain dengan produk, stok, transaksi, dan laporan. Produk ini bukan alat evaluasi prompt; siapkan environment sendiri sebelum mengintegrasikan AI.
Troubleshooting
Format sering salah
Pastikan mode output terstruktur benar-benar didukung endpoint dan model. Sederhanakan schema, kurangi field opsional, lalu validasi setelah parsing. Menyebut kata JSON saja tidak menjamin output valid.
Jawaban benar tetapi mengarang
Batasi sumber, minta nilai kosong atau needs_review saat data tidak tersedia, dan uji input tidak lengkap. Validasi bisnis tetap berada di aplikasi.
Prompt baru hanya membaik pada satu contoh
Bandingkan seluruh dataset, simpan test case yang gagal, dan revisi berdasarkan kategori kegagalan. Jika perlu, pecah workflow menjadi beberapa langkah kecil.
Checklist sebelum dipakai rutin
- Kriteria sukses dan dataset tertulis.
- Input normal, kosong, typo, dan ambigu diuji.
- Output divalidasi sebelum dipakai.
- Prompt, model, schema, dan dataset berversi.
- Kasus ambigu memiliki review manusia.
- Regression test dijalankan setiap prompt berubah.
Kesimpulan
Prompt yang baik menghasilkan jawaban cukup akurat dan konsisten pada kumpulan input yang mewakili kondisi nyata. Mulai dari dataset kecil, gunakan rubrik jelas, simpan kegagalan, dan ubah satu hal per iterasi.
Sumber primer: Google AI for Developers — Prompt design strategies, Anthropic — Prompt engineering overview, dan Google — Structured outputs, diperiksa 27 September 2026. Featured image: visual original Kuskuskuy, dibuat khusus untuk artikel ini dan tidak memakai gambar pihak ketiga.