Agent ArenaClickHouse Workshops
Agent Arena

Agent Arena — เวิร์กช็อป Langfuse

นำ LLM หลายตัวมาแข่งขันกัน คัดเลือกผู้ชนะสำหรับงาน NL→SQL บน ClickHouse แล้วปรับปรุงต่อไปเรื่อยๆ — ทั้งหมดนี้เชื่อมต่อกับ Langfuse ตั้งแต่ก้าวแรก

ยินดีต้อนรับสู่ Playbook ของ Agent Arena Agent Arena คือการแข่งขันแบบตัวต่อตัวสำหรับ agent ที่ขับเคลื่อนด้วย LLM ตลอดเวิร์กช็อปนี้ คุณจะนำ LLM หลายตัวมาเข้าสู่ การแข่งขัน สำหรับงานเฉพาะเจาะจงเพียงงานเดียว — การแปลงภาษาธรรมชาติเป็น SQL บนชุดข้อมูลอีคอมเมิร์ซที่รันอยู่บน ClickHouse — และคัดเลือก ผู้ชนะด้วยหลักฐานจริง ไม่ใช่จากลีดเดอร์บอร์ดสาธารณะ Langfuse ถูกเชื่อมต่อเข้ามาตั้งแต่ โมดูลแรก ไม่ใช่การเสริมเข้ามาทีหลัง โดยจะเป็นตัวที่รันการแข่งขัน วัดผลคุณภาพของ ผู้ชนะ ขับเคลื่อนการปรับปรุงอย่างต่อเนื่อง และติดตามไปจนถึงขั้นการใช้งานจริงในโปรดักชัน

ทำไมต้องเวิร์กช็อปนี้

เมื่อคุณสร้างแอปพลิเคชัน agent ที่จริงจัง หนึ่งในการตัดสินใจแรกๆ และมีผลกระทบมากที่สุด คือ จะเลือกใช้โมเดลไหน โมเดลแต่ละตัวมีความสามารถและราคาที่แตกต่างกันอย่างมาก และตัวเลือกที่ถูกต้องขึ้นอยู่กับงานของคุณโดยเฉพาะ ไม่ใช่จากลีดเดอร์บอร์ดสาธารณะ ของคนอื่น เดาผิดในจุดนี้แล้วคุณจะเสียเปรียบได้สองทาง คือจ่ายแพงเกินไปสำหรับโมเดล ระดับแนวหน้าที่คุณไม่ได้จำเป็นต้องใช้ หรือปล่อยใช้งานโมเดลราคาถูกที่ทำงานจริงของคุณผิดพลาดอย่างเงียบๆ

คำตอบที่มีระเบียบวินัยคือการรันการแข่งขันด้วยตัวเอง: นำกริดของโมเดลและกลยุทธ์การ prompt มารันผ่าน experiment ของ Langfuse เทียบกับ golden dataset ของคุณเอง แล้วให้ ต้นทุนต่อคำตอบที่ถูกต้อง — คุณภาพต่อดอลลาร์สำหรับ use case ของคุณ — เป็นตัวเลือกผู้ชนะ การตัดสินใจนั้นคือฐานที่ทุกอย่างต่อจากนี้ตั้งอยู่บน ไม่มีประโยชน์ที่จะไปวัดผล ปรับปรุง หรือปล่อยใช้งาน agent ที่สร้างขึ้นจากโมเดลผิดตัวไปแต่แรก

เวิร์กช็อปนี้ทำให้เรื่องนี้จับต้องได้ด้วยแชทบอท NL→SQL เป็น use case และหนึ่งขั้นตอนคือ เลือกโมเดลพื้นฐาน → วัดผลแบบออฟไลน์ → ปล่อยใช้งานและตรวจจับ → ตรวจสอบโดยมนุษย์ → ปิดวงจรการปรับปรุง Langfuse คือเส้นด้ายที่เชื่อมทุก ขั้นตอนเข้าด้วยกัน — ใช้โปรเจกต์เดียวกัน, trace, feedback, annotation, evaluator และ dataset เดียวกันตั้งแต่โมดูล 00 ไปจนถึงลูปการปรับปรุงในโปรดักชัน

Playbook นี้มีสองแทร็ก แทร็กผู้เรียน (Learner) คือบทเรียนที่คุณเดินตามในห้องเรียน ส่วน แทร็กผู้สอน (Instructor) คือคู่มือของวิทยากรสำหรับโมดูลเดียวกัน ครอบคลุมเรื่องการจับเวลา บทพูด ข้อผิดพลาดที่พบบ่อย และขั้นตอนการรีเซ็ต

โมดูล

#ผู้เรียนผู้สอนผลลัพธ์
00ตั้งค่าหมายเหตุเชื่อมต่อ OpenRouter, ClickHouse และ Langfuse เรียบร้อย — โดย Langfuse ถูกเชื่อมต่อไว้ก่อนที่จะเลือกโมเดลใดๆ — และ seed ชุดข้อมูล Agent Arena แล้ว
01เลือกโมเดลพื้นฐานหมายเหตุรันการแข่งขันในรูปแบบ experiment ของ Langfuse คัดเลือกผู้ชนะด้วยต้นทุนต่อคำตอบที่ถูกต้อง — การตัดสินใจพื้นฐานของทั้งหมด
02วัดผลแบบออฟไลน์หมายเหตุเข้าใจคุณภาพของผู้ชนะแยกตามคำถามและตามระดับก่อนปล่อยใช้งาน โดยใช้ evaluator, dataset และ trace ของ Langfuse
03ปล่อยใช้งานและตรวจจับหมายเหตุปล่อย agent ที่เลือกไว้ออกไปพร้อมกับจุดบอดของ policy ที่รู้อยู่แล้ว SQL ที่รันได้ผ่าน evaluator ด้านการทำงาน ในขณะที่ feedback จากผู้ใช้จริงตีตราคำตอบว่าผิด
04ตรวจสอบโดยมนุษย์หมายเหตุมนุษย์ตาม feedback เชิงลบไปยัง trace ต้นตอที่ถูกต้อง วินิจฉัยว่า policy ล้าสมัย ตรวจสอบยืนยันการแก้ไข และบันทึกแหล่งที่มาของข้อมูลในโปรดักชัน
05ปิดวงจรการปรับปรุงหมายเหตุเหตุการณ์ที่ผ่านการตรวจสอบแล้วกลายเป็น golden data experiment แบบจับคู่พิสูจน์การปรับปรุง มีการ calibrate และเปิดใช้งาน evaluator ของ policy แบบทั่วไปแบบออนไลน์ และเฝ้าติดตาม traffic ในอนาคต

ในหน้านี้

TH