Langfuse WorkshopClickHouse Workshops

04 Pemantauan

Panduan pelajar: 04 Pemantauan

Materi workshop dikelola dalam repositori publik langfuse/langfuse-workshop repository. Gunakan repositori untuk aplikasi yang dapat dijalankan, cabang checkpoint, dan pengaturan lokal.

Lihat file Markdown ini

Panduan pelajar: 04 Pemantauan

Catatan instruktur

  • Ini masih bab yang didahulukan UI, tetapi sekarang mencampur dua jenis evaluator: LLM-sebagai-hakim untuk sinyal semantik dan evaluator kode untuk sinyal frustrasi deterministik.
  • Tutup dengan penyemaian: setelah monitor aktif, npm run langfuse:seed:otel:no-scores menjatuhkan batch production lalu lintas realistis (termasuk di luar ruang lingkup, semua huruf besar, dan kasus tepi ketidaksetujuan) ke dalam proyek, dan karena evaluator sudah berjalan itu mendapat skor langsung — hasil "perhatikan monitor menyala dalam skala" yang memuaskan. Varian :no-scores disengaja — skor harus berasal dari evaluator pelajar sendiri, bukan dari benih. Ingatkan pelajar itu tidak idempoten (menjalankan ulang menggandakan data).
  • Sebelum evaluator pertama, konfirmkan proyek memiliki Project Settings → LLM Connections dikonfigurasi. Pada proyek segar wizard Set up evaluator mengalami pemblokiran pada langkah Set up LLM connection sampai model default disimpan — buat pelajar memilih koneksi OpenAI dan model yang mampu output terstruktur di sana.
  • Template terkelola aktif di bawah Use existing di halaman Set up evaluator. Pelajar yang mengklik Create from scratch → LLM as a judge evaluator berakhir dalam formulir Create new evaluator kosong dan berpikir template hilang — buat mereka menutup dialog dan memilih dari daftar.
  • Jelaskan mengapa dua monitor menargetkan pengamatan yang berbeda: di luar ruang lingkup memerlukan prompt sistem pada generasi, sementara ketidaksetujuan memerlukan riwayat percakapan pada akar agen.
  • Jelaskan mengapa monitor huruf besar berbasis kode: tidak ada panggilan model yang diperlukan ketika aturan deterministik sederhana cukup.
  • Gunakan hasil evaluator pertama sebagai latihan debug, bukan hanya pemeriksaan lulus/gagal.

Ritme demo

  1. Konfigurasikan Out-of-Scope Request pada pengamatan generasi terakhir.
  2. Konfigurasikan User Disagreement pada pengamatan dad-it-support-chat-turn agen.
  3. Konfigurasikan evaluator kode huruf-besar pada pengamatan dad-it-support-chat-turn agen yang sama.
  4. Kirim satu putaran bersih dalam ruang lingkup, satu putaran di luar ruang lingkup, satu putaran ketidaksetujuan, dan satu putaran huruf besar.
  5. Benih lalu lintas produksi dengan npm run langfuse:seed:otel:no-scores, kemudian segarkan tampilan Tracing dan saksikan evaluator langsung mencetak batch yang disemaikan.

Perhatikan

  • Secara tidak sengaja memilih template yang salah untuk User Disagreement.
  • Memperlakukan kunci API Langfuse dari .env sebagai cukup untuk evaluator. Evaluator berbasis hakim juga memerlukan koneksi LLM Langfuse-side.
  • Memetakan last_user_message ke item transkrip terakhir pada generasi terakhir; generasi terakhir mencakup pesan alat setelah putaran pengguna.
  • Untuk sinyal huruf besar, lebih suka versi Python dalam docs pelajar daripada melawan editor TypeScript.
  • Pelajar menganggap skor huruf-besar adalah jaminan kemarahan. Bingkai sebagai sinyal triase, bukan putusan.

Di halaman ini

ID