Agent Arena — เวิร์กช็อป Langfuse
นำ LLM หลายตัวมาแข่งขันกัน คัดเลือกผู้ชนะสำหรับงาน NL→SQL บน ClickHouse แล้วปรับปรุงต่อไปเรื่อยๆ — ทั้งหมดนี้เชื่อมต่อกับ Langfuse ตั้งแต่ก้าวแรก
ยินดีต้อนรับสู่ Playbook ของ Agent Arena Agent Arena คือการแข่งขันแบบตัวต่อตัวสำหรับ agent ที่ขับเคลื่อนด้วย LLM ตลอดเวิร์กช็อปนี้ คุณจะนำ LLM หลายตัวมาเข้าสู่ การแข่งขัน สำหรับงานเฉพาะเจาะจงเพียงงานเดียว — การแปลงภาษาธรรมชาติเป็น SQL บนชุดข้อมูลอีคอมเมิร์ซที่รันอยู่บน ClickHouse — และคัดเลือก ผู้ชนะด้วยหลักฐานจริง ไม่ใช่จากลีดเดอร์บอร์ดสาธารณะ Langfuse ถูกเชื่อมต่อเข้ามาตั้งแต่ โมดูลแรก ไม่ใช่การเสริมเข้ามาทีหลัง โดยจะเป็นตัวที่รันการแข่งขัน วัดผลคุณภาพของ ผู้ชนะ ขับเคลื่อนการปรับปรุงอย่างต่อเนื่อง และติดตามไปจนถึงขั้นการใช้งานจริงในโปรดักชัน
ทำไมต้องเวิร์กช็อปนี้
เมื่อคุณสร้างแอปพลิเคชัน agent ที่จริงจัง หนึ่งในการตัดสินใจแรกๆ และมีผลกระทบมากที่สุด คือ จะเลือกใช้โมเดลไหน โมเดลแต่ละตัวมีความสามารถและราคาที่แตกต่างกันอย่างมาก และตัวเลือกที่ถูกต้องขึ้นอยู่กับงานของคุณโดยเฉพาะ ไม่ใช่จากลีดเดอร์บอร์ดสาธารณะ ของคนอื่น เดาผิดในจุดนี้แล้วคุณจะเสียเปรียบได้สองทาง คือจ่ายแพงเกินไปสำหรับโมเดล ระดับแนวหน้าที่คุณไม่ได้จำเป็นต้องใช้ หรือปล่อยใช้งานโมเดลราคาถูกที่ทำงานจริงของคุณผิดพลาดอย่างเงียบๆ
คำตอบที่มีระเบียบวินัยคือการรันการแข่งขันด้วยตัวเอง: นำกริดของโมเดลและกลยุทธ์การ prompt มารันผ่าน experiment ของ Langfuse เทียบกับ golden dataset ของคุณเอง แล้วให้ ต้นทุนต่อคำตอบที่ถูกต้อง — คุณภาพต่อดอลลาร์สำหรับ use case ของคุณ — เป็นตัวเลือกผู้ชนะ การตัดสินใจนั้นคือฐานที่ทุกอย่างต่อจากนี้ตั้งอยู่บน ไม่มีประโยชน์ที่จะไปวัดผล ปรับปรุง หรือปล่อยใช้งาน agent ที่สร้างขึ้นจากโมเดลผิดตัวไปแต่แรก
เวิร์กช็อปนี้ทำให้เรื่องนี้จับต้องได้ด้วยแชทบอท NL→SQL เป็น use case และหนึ่งขั้นตอนคือ เลือกโมเดลพื้นฐาน → วัดผลแบบออฟไลน์ → ปล่อยใช้งานและตรวจจับ → ตรวจสอบโดยมนุษย์ → ปิดวงจรการปรับปรุง Langfuse คือเส้นด้ายที่เชื่อมทุก ขั้นตอนเข้าด้วยกัน — ใช้โปรเจกต์เดียวกัน, trace, feedback, annotation, evaluator และ dataset เดียวกันตั้งแต่โมดูล 00 ไปจนถึงลูปการปรับปรุงในโปรดักชัน
Playbook นี้มีสองแทร็ก แทร็กผู้เรียน (Learner) คือบทเรียนที่คุณเดินตามในห้องเรียน ส่วน แทร็กผู้สอน (Instructor) คือคู่มือของวิทยากรสำหรับโมดูลเดียวกัน ครอบคลุมเรื่องการจับเวลา บทพูด ข้อผิดพลาดที่พบบ่อย และขั้นตอนการรีเซ็ต
โมดูล
| # | ผู้เรียน | ผู้สอน | ผลลัพธ์ |
|---|---|---|---|
| 00 | ตั้งค่า | หมายเหตุ | เชื่อมต่อ OpenRouter, ClickHouse และ Langfuse เรียบร้อย — โดย Langfuse ถูกเชื่อมต่อไว้ก่อนที่จะเลือกโมเดลใดๆ — และ seed ชุดข้อมูล Agent Arena แล้ว |
| 01 | เลือกโมเดลพื้นฐาน | หมายเหตุ | รันการแข่งขันในรูปแบบ experiment ของ Langfuse คัดเลือกผู้ชนะด้วยต้นทุนต่อคำตอบที่ถูกต้อง — การตัดสินใจพื้นฐานของทั้งหมด |
| 02 | วัดผลแบบออฟไลน์ | หมายเหตุ | เข้าใจคุณภาพของผู้ชนะแยกตามคำถามและตามระดับก่อนปล่อยใช้งาน โดยใช้ evaluator, dataset และ trace ของ Langfuse |
| 03 | ปล่อยใช้งานและตรวจจับ | หมายเหตุ | ปล่อย agent ที่เลือกไว้ออกไปพร้อมกับจุดบอดของ policy ที่รู้อยู่แล้ว SQL ที่รันได้ผ่าน evaluator ด้านการทำงาน ในขณะที่ feedback จากผู้ใช้จริงตีตราคำตอบว่าผิด |
| 04 | ตรวจสอบโดยมนุษย์ | หมายเหตุ | มนุษย์ตาม feedback เชิงลบไปยัง trace ต้นตอที่ถูกต้อง วินิจฉัยว่า policy ล้าสมัย ตรวจสอบยืนยันการแก้ไข และบันทึกแหล่งที่มาของข้อมูลในโปรดักชัน |
| 05 | ปิดวงจรการปรับปรุง | หมายเหตุ | เหตุการณ์ที่ผ่านการตรวจสอบแล้วกลายเป็น golden data experiment แบบจับคู่พิสูจน์การปรับปรุง มีการ calibrate และเปิดใช้งาน evaluator ของ policy แบบทั่วไปแบบออนไลน์ และเฝ้าติดตาม traffic ในอนาคต |