Langfuse WorkshopClickHouse Workshops

06 การทดลอง

แนวทางผู้เรียน: 06 Experiments

เอกสารเวิร์กชอปนี้รักษาไว้ในที่เก็บข้อมูลสาธารณะ langfuse/langfuse-workshop ใช้ที่เก็บข้อมูลสำหรับแอปที่รันได้ สาขา checkpoint และการตั้งค่าในเครื่อง

ดูไฟล์ Markdown นี้

แนวทางผู้เรียน: 06 Experiments

หมายเหตุผู้สอน

  • ไอเดียหลักคือ reuse: experiment runner เรียก same runSupportConversation(...) เป็น web app
  • บางส่วน deterministic scoring ในสคริปต์ (keyword_overlap) ด้วย LLM-as-a-judge scoring (correctness)
  • ยืนยัน default evaluator model ก่อน Correctness setup ถ้าผู้เรียน ไม่ได้กำหนดค่าใน session 4 ส่งไปที่ Project Settings → LLM Connections ก่อน
  • เน้น mixed setup: สคริปต์소유เช็ค deterministic ราคาถูก ในขณะที่ Langfuse เป็นเจ้าของ semantic judge
  • เก็บ concurrency ที่หนึ่งสำหรับเวิร์กชอปดังนั้น traces และ final run summary ง่ายต่อการติดตาม

จังหวะการสาธิต

  1. Skim the numbered sections ใน scripts/run-dataset.ts
  2. ชี้ keyword_overlap evaluator ข้างในสคริปต์
  3. กำหนดค่า Correctness evaluator เป็น dataset-run evaluator
  4. รัน npm run dataset:run
  5. เปิด run table per-item traces และ chart view

ต้องระวัง

  • Correctness evaluator target เก็บ Run on ตั้ง Experiments ถ้าคุณต้องการ score เพื่อแสดง row run และใน run comparison
  • ให้ผู้เรียนสลับ Run on จาก default Observations เข้า Experiments ก่อน พวกเขากำหนดค่า อื่นใด
  • ถ้าไม่มี experiment run อยู่แล้ว review table หรือ prompt preview อาจ ว่าง นั่นเป็น expected ก่อน npm run dataset:run สร้างการรัน first
  • Correctness evaluator mapping ใช้สามแหล่ง dropdowns ที่แตกต่างกัน: query คือ Input ด้วย $.messages[-1].content generation คือ Output ปราศจาก JsonPath และ ground_truth คือ Expected Output ด้วย $.idealAnswer
  • ข้อผิดพลาดทั่วไป ปล่อย all three variables บน Input ซึ่ง silently ทำให้ evaluator อ่าน wrong data สำหรับทุกฟิลด์
  • ผู้เรียนสมมติว่า deterministic check ต้องสด ใน Langfuse ตอนนี้ มันไม่ได้ ระบุ code-evaluator docs เป็นทางเลือกเท่านั้น
  • "No default model set" หมายถึง Langfuse ต้องการ LLM connection/default evaluator model มันไม่ได้แก้ไข .env
  • Slow asynchronous evaluator results console เฉพาะ shows final summary ดังนั้น refresh Langfuse หลัง run เสร็จ ถ้า correctness ยังคงรอดำเนิน

ในหน้านี้

TH