AI Update

Cara Bikin 'Golden Dataset' dari Traffic Produksi Sendiri

OpenRouter bagi cara bikin dataset evaluasi dari traffic produk sendiri — biar regresi model kelihatan sebelum user yang nemuin duluan.

Diterbitkan oleh 2ndBrAIn1 Oktober 20264 min read
Share:XFacebookWhatsApp
Golden Dataset: Evaluasi Model dari Traffic Sendiri

Kalian ganti satu kalimat di prompt, atau provider diam-diam upgrade model di balik nama yang sama — terus minggu depan keluhan user berubah bentuk. Benchmark publik gak bakal nangkep itu.

Apa yang baru

  • Golden eval dataset: kumpulan input produksi asli yang expected output-nya sudah direview manusia dan divalidasi sebagai benar, dijalankan sebagai tes regresi sebelum tiap deploy.
  • Ukuran ideal beda-beda: cukup 10 contoh buat ngulik satu masalah spesifik, tapi butuh 100 sampai 1.000 buat regression set penuh — dan yang dikejar itu cakupan failure mode, bukan jumlah mentah.
  • Data produksi menang lawan data sintetis: karena distribusinya jujur — kalau 70 persen traffic soal harga, 70 persen dataset evaluasi juga harus soal harga, bukan skenario yang dikarang tim internal.
  • Lima langkah prosesnya: mulai dari narik sampel traffic mentah, dedup dan cluster biar gak nyimpen 50 variasi pertanyaan yang sama, sampai review manual buat nentuin expected output.
  • Setelah dataset jadi: set yang sama bisa dijalankan ke banyak model kandidat lewat satu API, jadi milih model berikutnya berdasarkan bukti dari traffic sendiri, bukan urutan leaderboard.

Cara kerjanya

Proses intinya lima langkah. Narik sampel satu-dua minggu traffic produksi (lebih lama kalau fiturnya musiman), lalu dedup dan cluster biar variasi pertanyaan yang sama gak diulang puluhan kali. Setiap contoh dikasih label metadata — intent, segmen user, timestamp, versi model yang ngasih jawaban — karena metadata ini gak bisa direkonstruksi belakangan kalau kelupaan dicatat.

Tahap berikutnya adalah review manusia buat nentuin expected output tiap item, atau nentuin item itu cukup dicek dengan kriteria tanpa referensi kayak format, keamanan, atau nada bicara. Baru setelah itu dataset divalidasi jadi baseline. Ini mirip guru yang bikin ulangan dari pertanyaan asli murid-muridnya selama satu semester, bukan dari bank soal generik yang dipakai sekolah lain — soal yang diambil dari kejadian nyata otomatis nyasar ke titik yang benar-benar bikin murid (atau user) kesulitan.

Bacaan berguna, sekali seminggu.

Kabar AI penting, konteksnya, dan satu hal yang bisa langsung kalian praktikkan.

Kenapa ini penting

Buat tim produk berbasis LLM di Indonesia, ini nutupin lubang yang sering diabaikan: model bisa lolos benchmark publik tapi tetep jeblok di traffic lokal kalian — campuran bahasa daerah, singkatan khas Indonesia, atau pertanyaan yang nyebut fitur produk yang udah diganti nama tiga bulan lalu. Golden set nangkep pola itu karena datanya emang dari user kalian sendiri, bukan dari imajinasi tim di negara lain.

Ini juga ngubah cara kalian pilih model. Daripada percaya klaim performa dari vendor, kalian bisa jalankan set yang sama ke beberapa model lewat satu pengaturan, mirip cara setup OpenRouter buat ganti model di banyak aplikasi tanpa ubah kode satu-satu — keputusan ganti model jadi berbasis bukti dari traffic sendiri, bukan tebakan.

Buat kalian

  • Yang harus peduli: kalian yang jalanin produk berbasis LLM dengan traffic user riil — chatbot, fitur AI di aplikasi, automasi customer support — dan pernah kaget kualitas jawaban turun setelah update prompt atau provider ganti versi model diam-diam.
  • Yang boleh santai: kalau produk kalian masih tahap prototipe tanpa traffic asli, belum perlu buru-buru — golden set butuh data produksi nyata, bukan data yang dikarang, jadi tunggu sampai ada cukup log buat disampel.
  • Langkah kecil pertama: tarik 50-100 log percakapan dari minggu terakhir, bikin cluster manual soal apa aja yang paling sering muncul, lalu review 10-20 di antaranya buat jadi baseline pertama. Itu udah cukup buat mulai nangkep regresi sebelum user yang ngadu duluan.

Yang bikin dataset kayak gini berharga bukan cuma teknisnya, tapi kebiasaan mengukur dari data sendiri sebelum percaya klaim orang lain — entah itu klaim vendor model atau testimoni orang lain soal automasi mereka. Prinsip yang sama ini yang gw latih bareng murid-murid di kelas gw: jangan percaya sebelum kalian punya cara sendiri buat ngecek.

Sumber primer: panduan resmi OpenRouter (openrouter.ai/blog/tutorials/building-a-golden-eval-dataset-from-production-traffic).

Lebih paham AI. Lebih siap menggunakannya.

Newsletter mingguan berisi kabar penting, konteks yang jernih, dan praktik yang bisa dicoba.

Belajar build sistem AI yang bekerja buat kalian

Lihat akademi