AI Update

Agent AI Kalian Lolos Tes — Belum Tentu Lolos Lagi Besok

IBM Research rilis Consistency Analyzer yang ungkap gap besar antara Mean@k dan Pass^k pada agent AI — krusial buat task finansial dan legal yang kritis.

Diterbitkan oleh 2ndBrAIn22 September 20263 min read
Share:XFacebookWhatsApp
Consistency Analyzer: Cek Pass^k Agent AI

Agent AI kalian lolos tes minggu ini dengan skor mentereng. Pertanyaan yang lebih penting: kalau task yang sama dijalanin lagi besok, apakah dia bakal lolos lagi — persis kayak kemarin?

Apa yang baru

  • Consistency Analyzer: alat baru dari IBM Research ngecek decision point yang rentan lewat resampling satu trace, tanpa perlu jawaban benar sebagai pembanding, dengan default k=5 completions per titik keputusan.
  • Gap yang ketauan: di benchmark AppWorld test_normal, agent ReAct berbasis GPT-4.1 dapet Mean@5 77.4% — kedengeran bagus — tapi Pass^5 cuma 53.0%, selisih 24.4 poin persentase.
  • Guidelines hasil analisis: nerapin consistency guidelines dari hasil analisis ini nurunin gap itu dari 24.4pp jadi 12.0pp, tanpa nurunin rata-rata akurasi.
  • Peningkatan konkret: Pass^5 pada same-task naik +16.0pp setelah guidelines diterapkan, tanpa biaya tambahan buat retraining atau fine-tuning ulang model.

Cara kerjanya

Consistency Analyzer resampling satu trace di titik-titik keputusan yang dicurigai rentan — gak perlu jawaban "benar" sebagai pembanding, cukup lihat seberapa beda agent milih jalan di kondisi yang identik. Default-nya, tiap decision point diresampling lima kali buat ngukur variasi itu, lalu hasilnya dipakai buat nyusun guidelines yang nutup celah paling gede duluan.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Metrik yang biasa dipamerin soal performa agent itu Mean@k — rata-rata keberhasilan dari beberapa kali run. Kedengerannya solid, tapi ada lubang: run yang gagal dan run yang berhasil dirata-ratain jadi satu angka yang enak dilihat. Pass^k ngukur hal beda — dari sekian kali run task yang sama, berapa persen yang beneran berhasil di semua percobaan, bukan cuma sebagian.

Bayangin kalian punya karyawan baru yang disuruh ngerjain proses yang sama lima kali. Kalau rata-rata empat dari lima kali dia bener, kedengerannya oke buat kerjaan santai. Tapi kalau prosesnya approve transaksi atau review klausul kontrak, yang kalian butuh bukan rata-rata — yang kalian butuh dia bener di setiap kesempatan, karena satu kesalahan gak bisa ditutup sama tiga keberhasilan lain.

Buat kalian yang deploy agent buat proses klaim, approve transaksi, atau review dokumen legal, gap 24.4 poin di atas bukan angka statistik doang. Kasus agent OpenAI yang nyasar ke Wiki Jerman sebulan tanpa ketahuan nunjukkin persis apa yang terjadi kalau inconsistency semacam ini gak kedeteksi dari awal — bukan karena agent-nya bego, tapi karena gak ada yang ngecek konsistensi antar run sebelum masuk production.

Buat kalian

  • Yang harus peduli: kalian yang deploy agent buat task finansial, legal, atau apa pun yang satu kesalahan gak bisa ditolerir cuma karena rata-ratanya bagus.
  • Yang boleh santai: kalau agent kalian cuma buat draft konten atau brainstorming yang selalu direview manual sebelum dipakai, Mean@k udah cukup jadi sinyal awal.
  • Langkah kecil pertama: sebelum agent kalian masuk production, jalanin task yang sama minimal 5 kali dan hitung berapa persen yang bener di SEMUA percobaan — bukan rata-rata dari lima angka yang beda-beda.

Konsistensi itu bukan cuma soal agent AI — itu prinsip yang berlaku di semua sistem yang kalian percaya buat kerja berulang: yang perlu diukur bukan seberapa bagus rata-ratanya, tapi seberapa sering dia gagal di titik yang sama. Itu salah satu cara evaluasi yang gw latih bareng murid-murid di kelas gw — nilai sistem otomatis dari seberapa tahan dia diulang, bukan dari satu demo yang mulus.

Sumber primer: blog resmi IBM Research di Hugging Face (huggingface.co/blog/ibm-research/altk-evolve-consistency).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi