Evaluasi prompt AI untuk pemula membantu kamu membedakan prompt yang berguna dari prompt yang hanya terdengar pintar. Jangan menilai prompt dari satu jawaban yang kebetulan bagus. Pakai workflow kecil yang dapat diulang: tentukan tugas, siapkan contoh, buat rubrik, uji, catat hasil, lalu revisi satu hal pada satu waktu.
Mengapa prompt perlu dievaluasi?
Prompt yang berhasil untuk satu pertanyaan belum tentu konsisten pada pertanyaan lain. Output bisa terlihat rapi tetapi kurang akurat, melewatkan syarat, atau tidak mengikuti format. Dokumentasi resmi OpenAI menjelaskan pentingnya menguji dan mengevaluasi output ketika prompt diiterasi.
Langkah 1: Tulis tujuan yang bisa diamati
Ganti tujuan umum seperti buat jawaban terbaik dengan tujuan yang dapat diperiksa: rangkum artikel menjadi lima poin, gunakan bahasa Indonesia natural, jangan menambahkan fakta, dan tandai informasi yang tidak ditemukan. Catat pembaca, panjang jawaban, sumber, format, serta larangan.
Langkah 2: Buat dataset mini
Siapkan lima sampai sepuluh input: kasus normal, informasi tidak lengkap, format khusus, kasus ambigu, dan kasus yang seharusnya meminta klarifikasi. Gunakan data dummy atau publik. Jangan memasukkan password, API key, data pelanggan, atau source code rahasia.
Langkah 3: Buat rubrik penilaian
- Akurasi: sesuai sumber atau fakta?
- Kelengkapan: semua bagian tugas dijawab?
- Format: struktur, panjang, dan bahasa sesuai?
- Keterlacakan: klaim penting dapat diperiksa?
- Keamanan: tidak melakukan tindakan yang tidak semestinya?
Gunakan skor 0 atau 1. Rubrik membantu menemukan pola, bukan menjamin kebenaran mutlak.
Langkah 4: Jalankan baseline
Simpan prompt pertama sebagai baseline. Jalankan semua input dengan konteks sama dan catat versi prompt, model jika diketahui, tanggal, output, skor, serta catatan reviewer.
Ringkas teks untuk pemula dalam 5 poin. Gunakan hanya informasi dari teks. Jika data penting tidak ada, tulis tidak ditemukan. Teks: [INPUT]Jangan mengubah banyak hal sekaligus. Baseline menunjukkan apakah revisi benar-benar memperbaiki hasil.
Langkah 5: Revisi dan uji ulang
Jika model melewatkan batasan, tambahkan format eksplisit. Jika model mengarang, minta pemisahan fakta, inferensi, dan informasi belum terverifikasi. Jika terlalu panjang, tetapkan batas. Uji ulang dataset lama lalu tambahkan input baru.
Contoh workflow belajar coding
Berikan versi PHP, pesan error lengkap, potongan kode minimal, hasil yang diharapkan, dan batasan perubahan. Minta penyebab, perubahan minimal, dan langkah verifikasi. Jalankan syntax check atau test di development; kode yang terlihat benar bukan bukti.
Untuk latihan membaca route, controller, database, dan view, Source Code Sistem Website – PHP, CodeIgniter & Laravel dapat dipakai sebagai referensi. Pilih satu project dan baca detail paket serta lisensinya sebelum digunakan.
Troubleshooting
Output berubah-ubah
Kurangi variasi konteks, tetapkan format, gunakan contoh representatif, dan nilai beberapa percobaan.
Model mengarang sumber
Minta model memakai sumber yang diberikan dan menandai klaim tanpa bukti. Buka serta cocokkan setiap sitasi secara manual.
Instruksi terlalu panjang
Pisahkan tujuan, aturan, format, dan contoh. Hapus aturan yang tumpang tindih.
JSON tidak valid
Berikan skema minimal dan validasi output dengan parser sebelum menyimpan atau mengirimkannya ke aplikasi.
Checklist
- Tujuan dan pengguna jelas.
- Ada input uji normal dan gagal.
- Rubrik memeriksa akurasi, kelengkapan, format, keterlacakan, dan keamanan.
- Baseline dan revisi disimpan.
- Data sensitif tidak dipakai.
- Keputusan penting punya review manusia dan fallback.
Kesimpulan
Evaluasi prompt AI tidak harus rumit. Dataset mini, rubrik sederhana, baseline, dan revisi bertahap sudah cukup untuk membangun kebiasaan sehat dan mengetahui kapan AI perlu diperiksa manusia.
Sumber dan kredit visual
Sumber primer: OpenAI Prompt engineering dan OpenAI Evals, diperiksa 23 September 2026. Featured image: visual original Kuskuskuy, dibuat khusus untuk artikel ini.