06 การทดลอง
แนวทางผู้เรียน: 06 Experiments
เอกสารเวิร์กชอปนี้รักษาไว้ในที่เก็บข้อมูลสาธารณะ langfuse/langfuse-workshop ใช้ที่เก็บข้อมูลสำหรับแอปที่รันได้ สาขา checkpoint และการตั้งค่าในเครื่อง
แนวทางผู้เรียน: 06 Experiments
หมายเหตุผู้สอน
- ไอเดียหลักคือ reuse: experiment runner เรียก same
runSupportConversation(...)เป็น web app - บางส่วน deterministic scoring ในสคริปต์ (
keyword_overlap) ด้วย LLM-as-a-judge scoring (correctness) - ยืนยัน default evaluator model ก่อน Correctness setup ถ้าผู้เรียน ไม่ได้กำหนดค่าใน session 4 ส่งไปที่ Project Settings → LLM Connections ก่อน
- เน้น mixed setup: สคริปต์소유เช็ค deterministic ราคาถูก ในขณะที่ Langfuse เป็นเจ้าของ semantic judge
- เก็บ concurrency ที่หนึ่งสำหรับเวิร์กชอปดังนั้น traces และ final run summary ง่ายต่อการติดตาม
จังหวะการสาธิต
- Skim the numbered sections ใน
scripts/run-dataset.ts - ชี้
keyword_overlapevaluator ข้างในสคริปต์ - กำหนดค่า Correctness evaluator เป็น dataset-run evaluator
- รัน
npm run dataset:run - เปิด run table per-item traces และ chart view
ต้องระวัง
- Correctness evaluator target เก็บ Run on ตั้ง Experiments ถ้าคุณต้องการ score เพื่อแสดง row run และใน run comparison
- ให้ผู้เรียนสลับ Run on จาก default Observations เข้า Experiments ก่อน พวกเขากำหนดค่า อื่นใด
- ถ้าไม่มี experiment run อยู่แล้ว review table หรือ prompt preview อาจ ว่าง นั่นเป็น expected ก่อน
npm run dataset:runสร้างการรัน first - Correctness evaluator mapping ใช้สามแหล่ง dropdowns ที่แตกต่างกัน:
queryคือ Input ด้วย$.messages[-1].contentgenerationคือ Output ปราศจาก JsonPath และground_truthคือ Expected Output ด้วย$.idealAnswer - ข้อผิดพลาดทั่วไป ปล่อย all three variables บน Input ซึ่ง silently ทำให้ evaluator อ่าน wrong data สำหรับทุกฟิลด์
- ผู้เรียนสมมติว่า deterministic check ต้องสด ใน Langfuse ตอนนี้ มันไม่ได้ ระบุ code-evaluator docs เป็นทางเลือกเท่านั้น
- "No default model set" หมายถึง Langfuse ต้องการ LLM connection/default evaluator model มันไม่ได้แก้ไข
.env - Slow asynchronous evaluator results console เฉพาะ shows final summary ดังนั้น refresh Langfuse หลัง run เสร็จ ถ้า
correctnessยังคงรอดำเนิน