04 Pemantauan
Panduan pelajar: 04 Pemantauan
Materi workshop dikelola dalam repositori publik langfuse/langfuse-workshop repository. Gunakan repositori untuk aplikasi yang dapat dijalankan, cabang checkpoint, dan pengaturan lokal.
Panduan pelajar: 04 Pemantauan
Catatan instruktur
- Ini masih bab yang didahulukan UI, tetapi sekarang mencampur dua jenis evaluator: LLM-sebagai-hakim untuk sinyal semantik dan evaluator kode untuk sinyal frustrasi deterministik.
- Tutup dengan penyemaian: setelah monitor aktif,
npm run langfuse:seed:otel:no-scoresmenjatuhkan batchproductionlalu lintas realistis (termasuk di luar ruang lingkup, semua huruf besar, dan kasus tepi ketidaksetujuan) ke dalam proyek, dan karena evaluator sudah berjalan itu mendapat skor langsung — hasil "perhatikan monitor menyala dalam skala" yang memuaskan. Varian:no-scoresdisengaja — skor harus berasal dari evaluator pelajar sendiri, bukan dari benih. Ingatkan pelajar itu tidak idempoten (menjalankan ulang menggandakan data). - Sebelum evaluator pertama, konfirmkan proyek memiliki Project Settings → LLM Connections dikonfigurasi. Pada proyek segar wizard Set up evaluator mengalami pemblokiran pada langkah Set up LLM connection sampai model default disimpan — buat pelajar memilih koneksi OpenAI dan model yang mampu output terstruktur di sana.
- Template terkelola aktif di bawah Use existing di halaman Set up evaluator. Pelajar yang mengklik Create from scratch → LLM as a judge evaluator berakhir dalam formulir Create new evaluator kosong dan berpikir template hilang — buat mereka menutup dialog dan memilih dari daftar.
- Jelaskan mengapa dua monitor menargetkan pengamatan yang berbeda: di luar ruang lingkup memerlukan prompt sistem pada generasi, sementara ketidaksetujuan memerlukan riwayat percakapan pada akar agen.
- Jelaskan mengapa monitor huruf besar berbasis kode: tidak ada panggilan model yang diperlukan ketika aturan deterministik sederhana cukup.
- Gunakan hasil evaluator pertama sebagai latihan debug, bukan hanya pemeriksaan lulus/gagal.
Ritme demo
- Konfigurasikan Out-of-Scope Request pada pengamatan generasi terakhir.
- Konfigurasikan User Disagreement pada pengamatan
dad-it-support-chat-turnagen. - Konfigurasikan evaluator kode huruf-besar pada pengamatan
dad-it-support-chat-turnagen yang sama. - Kirim satu putaran bersih dalam ruang lingkup, satu putaran di luar ruang lingkup, satu putaran ketidaksetujuan, dan satu putaran huruf besar.
- Benih lalu lintas produksi dengan
npm run langfuse:seed:otel:no-scores, kemudian segarkan tampilan Tracing dan saksikan evaluator langsung mencetak batch yang disemaikan.
Perhatikan
- Secara tidak sengaja memilih template yang salah untuk User Disagreement.
- Memperlakukan kunci API Langfuse dari
.envsebagai cukup untuk evaluator. Evaluator berbasis hakim juga memerlukan koneksi LLM Langfuse-side. - Memetakan
last_user_messageke item transkrip terakhir pada generasi terakhir; generasi terakhir mencakup pesan alat setelah putaran pengguna. - Untuk sinyal huruf besar, lebih suka versi Python dalam docs pelajar daripada melawan editor TypeScript.
- Pelajar menganggap skor huruf-besar adalah jaminan kemarahan. Bingkai sebagai sinyal triase, bukan putusan.