Agent ArenaClickHouse Workshops

02 Ukur kualitas

Catatan instruktur untuk modul 02 — timing, talk track, kegagalan yang umum terjadi, dan langkah reset.

Pendamping fasilitator untuk pelajaran learner 02 Ukur kualitas.

Timing

Total ~15 menit.

  • 5 min — akurasi per tier dan rincian outcome pada tampilan detail Leaderboard config pemenang.
  • 4 min — score sekunder agent-arena-llm-judge, dan di mana ia tidak sepakat dengan correctness.
  • 6 min — telusuri dua atau tiga trace Langfuse individual untuk pertanyaan yang salah/bernilai rendah.

Talk track

  • Rangkai ulang tujuannya: menang di Arena hanya memberi tahu bahwa satu config mengalahkan yang lain secara agregat; modul ini tentang bagaimana ia menang dan di mana ia paling lemah — gagasan yang sama dengan mengetahui bukan cuma bahwa seorang kandidat lulus wawancara, tetapi pertanyaan mana yang dia kuasai.
  • Katakan secara eksplisit bahwa modul ini tidak menghasilkan data baru — semua di sini sudah ditangkap correctness dan score agent-arena-llm-judge yang dihasilkan definisi evaluator llm_judge di Modul 01. Ini latihan membaca, bukan menjalankan ulang.
  • Tegaskan penyebutnya: sumber repo memiliki 20 pertanyaan YAML, tetapi q019 dan q020 adalah holdout few-shot, sehingga Experiment memiliki 18 dataset item yang dinilai.
  • Soal akurasi per tier: tunjukkan bahwa sebuah config bisa tampak kuat secara keseluruhan padahal goyah di tier tersulit, dan itu persis yang disembunyikan angka leaderboard agregat.
  • Soal rincian outcome: telusuri kategorinya dengan lantang — SQL yang ditolak sandbox, error ClickHouse, hasil kosong, result set yang salah — dan bahwa masing-masing adalah jenis masalah berbeda dengan perbaikan berbeda, bukan satu "kegagalan" tanpa pembeda.
  • Soal agent-arena-llm-judge: ia adik yang lebih halus dari correctness biner — sebuah config bisa benar menurut execution accuracy sambil menulis SQL yang tetap akan ditandai reviewer (subquery yang tidak perlu, perbandingan tanggal yang rapuh). Temukan satu ketidaksepakatan langsung antara correctness dan agent-arena-llm-judge kalau bisa, itu cara paling jelas membuat pembedaan itu tertanam.
  • Tutup dengan memilih dua atau tiga pertanyaan yang salah/bernilai rendah dan membaca trace-nya penuh dari awal sampai akhir secara live — prompt yang dikirim, SQL yang dihasilkan, error atau hasil — mencari dengan lantang sebuah pola (satu frasa, satu join, satu filter tanggal yang terus salah ditangani model). Ini keterampilan membaca trace yang sama yang dipakai ulang Modul 04 pada trafik produksi.

Kegagalan yang umum terjadi

  • Evaluator Langfuse belum dikonfigurasi — tidak ada score agent-arena-llm-judge atau correctness yang bisa menjadi dasar modul ini. Kembali ke Modul 01, perbaiki target/filter evaluatornya, dan jalankan grid kecil yang baru sebelum melanjutkan.
  • Tidak ada jawaban salah untuk ditelusuri — kalau config pemenang mendapat 100% pada grid demo, pilih kegagalan config yang bukan pemenang; keterampilan membaca trace itulah intinya, bukan menemukan cacat pada pemenang secara spesifik.
  • ClickHouse belum ter-seed / harness belum pernah jalan — tampilan detail Leaderboard (akurasi per tier, rincian outcome) kosong. Ini berarti Modul 01 belum selesai; kembali dan jalankan ulang sebelum melanjutkan.
  • Klik menuju trace berujung 404 atau membuka project yang salah — biasanya berarti browser diarahkan ke project Langfuse yang berbeda dari yang ada di .env, atau LANGFUSE_BASE_URL/key-nya tidak cocok dengan akun yang menjalankan harness Modul 01.

Langkah reset

  • Kalau tampilan detail Leaderboard kosong, seed ulang dan jalankan ulang subset murahnya: scripts/arena.sh up, lalu python -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect.
  • Pakai --run-id yang baru untuk run ulangnya supaya jelas baris Leaderboard mana dan Experiment Langfuse mana yang kamu baca di ruangan.
  • Kalau cuma render dashboard-nya yang macet (Experiment sudah ada di Langfuse), jalankan ulang server lokalnya tanpa seed ulang: scripts/arena.sh stop && scripts/arena.sh serve.
  • Kalau evaluator yang menjadi celahnya, kedalaman modul ini bergantung pada perbaikan itu sebelum sesi berikutnya — tidak ada pengganti di dalam sesi untuk score di sisi Langfuse.

Di halaman ini

ID