Langfuse WorkshopClickHouse Workshops

06 Eksperimen

Panduan pelajar: 06 Eksperimen

Materi workshop dikelola dalam repositori publik langfuse/langfuse-workshop repository. Gunakan repositori untuk aplikasi yang dapat dijalankan, cabang checkpoint, dan pengaturan lokal.

Lihat file Markdown ini

Panduan pelajar: 06 Eksperimen

Catatan instruktur

  • Ide utamanya adalah penggunaan ulang: pelari eksperimen memanggil runSupportConversation(...) yang sama dengan aplikasi web.
  • Kontraskan penilaian deterministik dalam skrip (keyword_overlap) dengan penilaian LLM-sebagai-hakim (correctness).
  • Konfirmkan model evaluator default sebelum penyetelan Correctness. Jika pelajar tidak mengonfigurasinya dalam sesi 4, kirim mereka ke Project Settings → LLM Connections terlebih dahulu.
  • Tekankan pengaturan campuran: skrip memiliki pemeriksaan deterministik yang murah, sementara Langfuse memiliki hakim semantik.
  • Jaga konkurensi di satu untuk workshop sehingga jejak dan ringkasan run akhir mudah diikuti.

Ritme demo

  1. Skim bagian bernomor di scripts/run-dataset.ts.
  2. Tunjukkan evaluator keyword_overlap di dalam skrip.
  3. Konfigurasikan evaluator Correctness sebagai evaluator dataset-run.
  4. Jalankan npm run dataset:run.
  5. Buka tabel run, jejak per-item, dan tampilan bagan.

Perhatikan

  • Target evaluator Correctness. Jaga Run on atur ke Experiments jika Anda ingin skor muncul di baris run dan dalam perbandingan run.
  • Buat pelajar beralih Run on dari default Observations ke Experiments sebelum mereka mengonfigurasi apa pun.
  • Jika belum ada eksperimen run, tabel review atau pratinjau prompt mungkin kosong. Itu diharapkan sebelum npm run dataset:run membuat run pertama.
  • Pemetaan evaluator Correctness menggunakan tiga dropdown sumber yang berbeda: query adalah Input dengan $.messages[-1].content, generation adalah Output tanpa JsonPath, dan ground_truth adalah Expected Output dengan $.idealAnswer.
  • Kesalahan konfigurasi umum adalah membiarkan ketiga variabel di Input, yang secara diam-diam membuat evaluator membaca data yang salah untuk setiap bidang.
  • Pelajar menganggap pemeriksaan deterministik harus aktif di Langfuse sekarang. Tidak; sebutkan docs evaluator kode hanya sebagai alternatif.
  • "No default model set" berarti Langfuse memerlukan koneksi LLM/model evaluator default; itu tidak diperbaiki dengan mengedit .env.
  • Hasil evaluator asinkron lambat; konsol hanya menunjukkan ringkasan akhir, jadi segarkan Langfuse setelah run selesai jika correctness masih tertunda.

Di halaman ini

ID