Langsung ke konten
Kuskuskuy JournalTeknologi yang bisa dipakai. Kuskuskuy.com
Langsung ke isi artikel

Tes Regresi Prompt AI: Cara Menguji Perubahan Sebelum Dipakai

Pelajari cara membuat tes regresi prompt AI dengan dataset kecil, rubrik evaluasi, baseline, dan troubleshooting agar perubahan prompt tidak diam-diam menurunkan kualitas output.

Tes Regresi Prompt AI: Cara Menguji Perubahan Sebelum Dipakai

Tes regresi prompt AI adalah cara sederhana untuk memastikan perubahan instruksi tidak memperbaiki satu contoh tetapi merusak banyak contoh lain. Ini penting ketika prompt dipakai berulang kali untuk customer support, ekstraksi data, klasifikasi, dokumentasi, atau bantuan coding.

Menurut dokumentasi resmi OpenAI tentang evals, evaluasi membantu menguji output terhadap kriteria yang sudah ditentukan. Polanya bukan sekadar bertanya lalu memilih jawaban yang terasa bagus: buat tugas, jalankan pada input uji, analisis hasil, lalu iterasikan prompt.

Apa itu regresi prompt?

Regresi terjadi ketika versi prompt baru menimbulkan penurunan pada perilaku yang sebelumnya sudah benar. Misalnya prompt baru membuat ringkasan lebih detail, tetapi sekarang sering menambahkan fakta yang tidak ada di sumber. Atau prompt coding menghasilkan solusi yang lebih panjang, tetapi lupa mengikuti batasan file yang tidak boleh diubah.

Prompt regression test membandingkan baseline dengan versi baru menggunakan input yang sama. Dengan begitu, kamu tidak hanya menilai contoh paling baru atau output yang kebetulan terlihat menarik.

Langkah 1: Tentukan tugas dan batasannya

Tulis tujuan dalam satu kalimat. Contoh: “Klasifikasikan pertanyaan pelanggan menjadi billing, teknis, atau lainnya; gunakan hanya informasi pada tiket; jika data kurang, tandai perlu review.” Hindari tujuan kabur seperti “buat jawaban terbaik”.

Catat juga hal yang tidak boleh berubah: format output, bahasa, panjang maksimum, field wajib, sumber yang boleh digunakan, dan kondisi yang harus dieskalasikan ke manusia. Batasan ini nantinya menjadi bagian dari rubrik.

Langkah 2: Buat dataset kecil tetapi beragam

Mulai dengan 10 sampai 20 input yang aman dan tidak mengandung password, token, data pelanggan nyata, atau informasi sensitif. Masukkan contoh normal, ambigu, kosong, typo, panjang, campuran bahasa, dan permintaan yang seharusnya ditolak atau diarahkan ke review.

Untuk tiap input, siapkan expected result sederhana. Expected result tidak harus berupa jawaban panjang. Bisa berupa label, field wajib, fakta yang harus muncul, atau alasan mengapa kasus perlu ditinjau manusia.

Langkah 3: Simpan baseline

Jalankan prompt lama pada dataset yang sama. Simpan prompt version, model, input, output, waktu, error, dan penilaian. Jangan hanya menyimpan output yang bagus. Kegagalan juga merupakan data penting untuk membandingkan perubahan.

Jika workflow memakai source code, buat folder atau checkpoint yang jelas. Koleksi Source Code Sistem Website – PHP, CodeIgniter & Laravel dapat menjadi bahan latihan untuk membuat fitur evaluasi sederhana di aplikasi web. Gunakan project contoh di environment development, bukan langsung mengubah sistem produksi.

Langkah 4: Buat rubrik yang bisa diperiksa

Gunakan kriteria yang cukup konkret. Contoh rubrik untuk ekstraksi data:

  • Format: output dapat diparse dan field wajib tersedia.
  • Kesesuaian sumber: tidak ada klaim di luar input.
  • Kelengkapan: informasi penting tidak terlewat.
  • Aturan bisnis: enum, tipe, dan rentang nilai benar.
  • Keamanan: kasus sensitif tidak dijawab secara sembrono dan ditandai untuk review.

Mulai dengan skor biner lulus/gagal agar konsisten. Setelah dataset dan rubrik stabil, kamu bisa menambah skor 0 sampai 2 atau memakai grader yang lebih canggih. Yang penting, definisi lulus ditulis sebelum melihat hasil versi baru.

Langkah 5: Bandingkan versi prompt

Ubah satu hal pada satu waktu. Jalankan prompt baru pada input yang sama, lalu bandingkan dengan baseline berdasarkan rubrik. Hitung berapa input yang lulus, mana yang berubah, dan apakah perubahan itu memang diinginkan.

Jangan mengejar nilai rata-rata saja. Satu kegagalan kritis pada kategori keamanan bisa lebih penting daripada beberapa peningkatan kecil pada gaya bahasa. Pisahkan metrik format, fakta, kualitas, latency, dan biaya supaya trade-off terlihat.

Contoh workflow praktis

  1. Buat file dataset berisi input dan expected labels.
  2. Jalankan prompt v1 dan simpan hasilnya sebagai baseline.
  3. Ubah satu instruksi, misalnya menambahkan aturan “jika tidak ditemukan, tulis null”.
  4. Jalankan prompt v2 dengan model dan parameter yang sama bila memungkinkan.
  5. Validasi format secara programatik, lalu review kasus gagal.
  6. Catat keputusan: terima, revisi, atau batalkan perubahan.

Untuk output terstruktur, validasi JSON di luar model. JSON yang valid belum tentu benar: ID harus dicari ulang ke sumber data, jumlah harus diperiksa, dan status sensitif tidak boleh ditentukan hanya dari teks model.

Troubleshooting

Hasil berubah-ubah

Periksa apakah parameter sampling, model, versi prompt, dan data benar-benar sama. Jika workflow memang non-deterministik, jalankan beberapa kali dan laporkan rentang hasil, bukan satu angka seolah-olah pasti.

Semua output terlihat bagus, tetapi gagal di production

Dataset mungkin terlalu bersih. Tambahkan typo, input kosong, bahasa campuran, konteks yang hilang, dan contoh adversarial yang aman. Uji juga panjang input, timeout, rate limit, refusal, serta fallback ketika provider tidak tersedia.

Skor tinggi tetapi pengguna mengeluh

Rubrik belum mewakili kebutuhan nyata. Ambil kasus anonim dari feedback, ubah menjadi fixture, lalu tambahkan kriteria yang menjelaskan keluhan tersebut. Evaluasi harus berkembang bersama workflow, bukan berhenti di dataset pertama.

Prompt baru lebih panjang dan mahal

Ukur token, latency, dan biaya sebagai metrik terpisah. Hapus instruksi yang redundan, pindahkan konteks yang jarang dipakai ke langkah bersyarat, dan pastikan prompt tetap mudah dipahami manusia.

Checklist sebelum merilis prompt

  • Ada dataset representatif dan aman.
  • Baseline tersimpan dan bisa diulang.
  • Rubrik lulus/gagal ditulis dengan jelas.
  • Perubahan dibandingkan pada input yang sama.
  • Kasus keamanan dan eskalasi diuji.
  • Output divalidasi di luar model.
  • Latency, token, error, dan biaya dicatat.
  • Ada rollback ke versi prompt sebelumnya.

Kesimpulan

Tes regresi prompt AI membuat proses perbaikan lebih terukur. Kamu tidak perlu langsung membangun platform evaluasi besar. Mulai dari dataset kecil, baseline, rubrik konkret, dan catatan versi. Setelah workflow stabil, perluas coverage berdasarkan kasus nyata dan feedback pengguna.

AI membantu menghasilkan output, tetapi evaluasi menentukan apakah output itu layak dipakai. Pisahkan model dari sumber kebenaran, verifikasi hasil di aplikasi, dan sediakan jalur review manusia untuk keputusan penting.

Sumber dan kredit visual

Sumber primer: OpenAI Working with evals dan OpenAI Prompt engineering, diperiksa 25 September 2026. Featured image: visual original Kuskuskuy, dibuat khusus untuk artikel ini pada 25 September 2026.