Langsung ke konten
Kuskuskuy JournalTeknologi yang bisa dipakai. Kuskuskuy.com
Langsung ke isi artikel

Anthropic Usulkan Metrik Baru untuk Mengukur Laju Perkembangan AI

Anthropic memperkenalkan tiga metrik untuk membantu publik memahami seberapa cepat AI ikut membangun AI, bagaimana agen diawasi, dan ke mana komputasi dialokasikan.

Anthropic Usulkan Metrik Baru untuk Mengukur Laju Perkembangan AI

Metrik perkembangan AI frontier labs membantu kita melihat bahwa perkembangan AI terbaru tidak hanya terlihat dari model baru atau skor benchmark. Pada 17 September 2026, Anthropic mengusulkan cara lain untuk membaca lajunya: melihat proses di balik pembangunan model itu sendiri. Gagasan ini penting karena sistem AI mulai dipakai untuk membantu riset dan pengembangan generasi berikutnya.

Dalam tulisan resminya, Anthropic membagikan tiga kelompok pengukuran: seberapa besar AI mengerjakan riset dan pengembangan AI, seberapa baik tindakan agen AI dapat diawasi, serta bagaimana sumber daya komputasi dialokasikan. Perusahaan juga menyebut akan menggandeng evaluator independen untuk membantu membuat angka dan proses tersebut lebih dapat diverifikasi.

Mengapa metrik proses AI mulai dibutuhkan?

Selama ini, publik lebih sering melihat hasil akhir: kemampuan model, skor evaluasi, atau fitur yang dirilis. Angka itu tetap berguna, tetapi belum selalu menjawab pertanyaan tentang seberapa cepat sebuah lab bergerak dan faktor apa yang mendorongnya.

Anthropic berargumen bahwa memahami input proses—misalnya komputasi dan tingkat otomatisasi riset—dapat melengkapi evaluasi kemampuan. Bagi pembuat kebijakan, developer, dan bisnis, konteks ini membantu membedakan peningkatan yang berasal dari model, data, infrastruktur, atau otomasi kerja internal.

Tiga metrik yang diperkenalkan Anthropic

1. Seberapa banyak AI ikut membangun AI

Pengukuran pertama melihat bagian pekerjaan AI research and development yang dilakukan oleh sistem AI, bukan hanya manusia. Pertanyaannya bukan sekadar apakah peneliti memakai chatbot, tetapi seberapa jauh AI membantu eksperimen, analisis, coding, evaluasi, atau tahap lain dalam membuat model berikutnya.

Metrik ini berpotensi memberi gambaran tentang umpan balik: model yang lebih kuat dapat membantu mempercepat pembuatan model baru. Namun angka tersebut harus dibaca bersama definisi tugas dan metode pengukuran. “Dibantu AI” bisa berarti banyak hal, mulai dari saran kecil sampai agen yang menyelesaikan rangkaian pekerjaan.

2. Seberapa baik tindakan agen diawasi

Agen AI dapat menjalankan tugas lebih panjang dan memakai berbagai alat. Karena itu, metrik kedua menilai kemampuan manusia atau sistem pengawasan untuk melihat, memahami, dan menghentikan tindakan agen ketika diperlukan.

Untuk penggunaan bisnis, prinsipnya cukup praktis: jangan hanya mengukur apakah agen menyelesaikan tugas. Ukur juga apakah log-nya terbaca, keputusan penting bisa ditelusuri, aksesnya dibatasi, dan operator dapat mengambil alih saat hasilnya meragukan.

3. Bagaimana komputasi dialokasikan

Metrik ketiga berfokus pada sumber daya komputasi yang dipakai untuk mengembangkan dan menjalankan sistem. Pembaca perlu membedakan jumlah komputasi, jenis pekerjaan, fase pelatihan atau evaluasi, serta efisiensi yang dihasilkan.

Angka komputasi tanpa konteks dapat menyesatkan. Dua eksperimen dengan jumlah GPU yang sama belum tentu mempunyai tujuan, durasi, model, atau hasil yang sama. Karena itu, transparansi metodologi menjadi bagian penting dari metrik ini.

Anthropic menggandeng evaluator independen

Pada 18 September 2026, Anthropic mengumumkan kemitraan dengan Faculty, bagian khusus AI dari Accenture, untuk evaluasi independen frontier AI. Rencananya mencakup evaluasi dan red-teaming model, penilaian alignment, serta pengujian pengaman.

Anthropic menyebut kedua pihak masing-masing berharap berinvestasi setidaknya 1 miliar dolar dalam kapasitas area ini selama lima tahun. Detail praktik embedded evaluation masih dikembangkan, termasuk standar akses, cara pelaporan, dan pendanaan evaluator. Karena itu, pengumuman ini lebih tepat dibaca sebagai langkah awal membangun mekanisme verifikasi, bukan sebagai bukti bahwa masalah pengawasan sudah selesai.

Apa artinya bagi developer dan bisnis?

Perkembangan ini memberi pelajaran bahwa fitur AI sebaiknya dibangun bersama observability. Saat membuat agent atau workflow otomatis, catat tujuan, alat yang boleh dipakai, batas data, event penting, serta alasan ketika sistem meminta persetujuan manusia.

Bisnis juga perlu memisahkan pekerjaan yang deterministik dari pekerjaan yang membutuhkan interpretasi. Status pembayaran, izin akses, dan perubahan data penting sebaiknya tetap berasal dari aturan serta sumber yang dapat diverifikasi. AI dapat membantu merangkum error, menyusun draft, atau mengelompokkan permintaan, tetapi tidak perlu diberi kewenangan lebih besar dari yang dibutuhkan.

Untuk developer yang mengelola software self-hosted, Source Code License Manager CI4 dapat menjadi referensi untuk mempelajari domain binding, signed token, audit log, dan kontrol instalasi. Detail fitur, kebutuhan server, serta lisensinya tetap perlu dibaca di halaman produk sebelum menentukan kecocokan.

Hal yang masih perlu dijawab

  • Definisi apa yang konsisten untuk membandingkan kontribusi AI antar-lab?
  • Seberapa independen evaluator jika pendanaannya masih berasal dari lab yang dievaluasi?
  • Data apa yang dapat dibuka ke publik tanpa membocorkan keamanan atau rahasia dagang?
  • Bagaimana metrik tersebut berubah ketika model dan agent makin mampu?

Pertanyaan ini menunjukkan mengapa angka perlu disertai metodologi, periode pengukuran, batasan, dan akses audit yang masuk akal. Satu snapshot belum cukup untuk menyimpulkan tren jangka panjang.

Kesimpulan

Usulan Anthropic menggeser perhatian dari sekadar “model ini bisa apa?” ke “bagaimana model dibangun, diawasi, dan diberi sumber daya?”. Tiga metrik—kontribusi AI pada AI R&D, kualitas pengawasan agen, dan alokasi komputasi—dapat membantu publik memahami laju perkembangan frontier AI dengan lebih utuh.

Bagi tim yang sedang membangun produk, pelajarannya sederhana: otomasi harus diikuti batas akses, audit trail, evaluasi, dan jalur intervensi manusia. AI yang cepat bukan berarti sistem boleh berjalan tanpa jejak.

Sumber dan kredit visual

Sumber primer: Anthropic Institute — Measurements for understanding the pace of AI development inside frontier labs, diperiksa 22 September 2026; dan Anthropic — Partnering with Accenture on embedded evaluation, diterbitkan 18 September 2026.

Featured image: visual original Kuskuskuy, dibuat khusus untuk artikel ini pada 22 September 2026.