Langsung ke konten
Kuskuskuy JournalTeknologi yang bisa dipakai. Kuskuskuy.com
Langsung ke isi artikel

Rubrik Skor Prompt AI: Uji Hasil dengan Dataset Kecil

Pelajari cara mengevaluasi prompt AI dengan dataset kecil, rubrik penilaian, contoh workflow, dan troubleshooting agar hasilnya lebih konsisten sebelum dipakai rutin.

Rubrik Skor Prompt AI: Uji Hasil dengan Dataset Kecil

Mengevaluasi prompt AI bukan hanya memilih jawaban yang terdengar pintar. Jika prompt dipakai untuk ringkasan, klasifikasi, atau ekstraksi data, uji apakah hasilnya tetap masuk akal ketika input berubah. Tutorial ini memakai dataset kecil agar bisa langsung dipraktikkan.

Alurnya: simpan contoh input, tetapkan output acuan, jalankan prompt, beri nilai dengan rubrik yang sama, lalu perbaiki satu hal dalam satu siklus. Dengan begitu, kamu bisa membedakan prompt yang benar-benar membaik dari prompt yang hanya kebetulan menghasilkan satu jawaban bagus.

Tentukan tugas dan kriteria sukses

Pilih tugas sempit, misalnya mengelompokkan pesan menjadi stok, pengiriman, atau lainnya. Tulis aturan sebelum melihat hasil: label harus berasal dari daftar, alasan maksimal satu kalimat, dan kasus ambigu ditandai untuk review. Kriteria ini menjadi rubrik yang konsisten.

Buat dataset kecil yang beragam

Mulai dengan 10 sampai 20 contoh aman. Campurkan input normal, typo, kalimat pendek, bahasa campuran, informasi kosong, dan contoh yang seharusnya ditolak. Tulis jawaban acuan untuk setiap input. Jangan memasukkan password, token, data pelanggan, atau informasi rahasia. Dataset kecil memberi sinyal awal, tetapi bukan pengganti pengujian luas.

Susun prompt dan workflow evaluasi

Pisahkan konteks, tugas, batasan, dan format output. Minta model tidak menebak serta mengembalikan field stabil. Simpan prompt versi 1, jalankan semua contoh, parse output, validasi schema, beri skor, lalu kelompokkan kegagalan. Ubah satu bagian saja dan jalankan dataset yang sama lagi. Catat accuracy, format pass rate, groundedness, ambiguity recall, latency, biaya, dan error provider.

  • Accuracy: jawaban sesuai acuan.
  • Format: output dapat diparse dan field wajib tersedia.
  • Groundedness: klaim berasal dari input atau sumber yang diizinkan.
  • Stability: hasil tetap masuk akal pada pengulangan.

Untuk latihan workflow data bisnis, Aplikasi Kasir - Simpel-POS dapat menjadi contoh domain dengan produk, stok, transaksi, dan laporan. Produk ini bukan alat evaluasi prompt; siapkan environment sendiri sebelum mengintegrasikan AI.

Troubleshooting

Format sering salah

Pastikan mode output terstruktur benar-benar didukung endpoint dan model. Sederhanakan schema, kurangi field opsional, lalu validasi setelah parsing. Menyebut kata JSON saja tidak menjamin output valid.

Jawaban benar tetapi mengarang

Batasi sumber, minta nilai kosong atau needs_review saat data tidak tersedia, dan uji input tidak lengkap. Validasi bisnis tetap berada di aplikasi.

Prompt baru hanya membaik pada satu contoh

Bandingkan seluruh dataset, simpan test case yang gagal, dan revisi berdasarkan kategori kegagalan. Jika perlu, pecah workflow menjadi beberapa langkah kecil.

Checklist sebelum dipakai rutin

  • Kriteria sukses dan dataset tertulis.
  • Input normal, kosong, typo, dan ambigu diuji.
  • Output divalidasi sebelum dipakai.
  • Prompt, model, schema, dan dataset berversi.
  • Kasus ambigu memiliki review manusia.
  • Regression test dijalankan setiap prompt berubah.

Kesimpulan

Prompt yang baik menghasilkan jawaban cukup akurat dan konsisten pada kumpulan input yang mewakili kondisi nyata. Mulai dari dataset kecil, gunakan rubrik jelas, simpan kegagalan, dan ubah satu hal per iterasi.

Sumber primer: Google AI for Developers — Prompt design strategies, Anthropic — Prompt engineering overview, dan Google — Structured outputs, diperiksa 27 September 2026. Featured image: visual original Kuskuskuy, dibuat khusus untuk artikel ini dan tidak memakai gambar pihak ketiga.