เส้นทางผู้เรียน
บทเรียนภาคปฏิบัติที่คุณจะทำระหว่างเซสชัน
นี่คือเส้นทางผู้เรียน: บทเรียนภาคปฏิบัติที่คุณจะทำระหว่างเวิร์กช็อป แต่ละโมดูลต่อยอดจากโมดูลก่อนหน้า โดยพาแชทบอท Agent Arena NL→SQL ผ่านโฟลว์เดียวกัน: เลือกโมเดลพื้นฐาน → วัดผลแบบออฟไลน์ → ปล่อยใช้งานและตรวจจับ → ตรวจสอบโดยมนุษย์ → ปิดวงจรการปรับปรุง — ทั้งหมดนี้ติดตั้งเครื่องมือด้วย Langfuse ตั้งแต่ โมดูลแรก ให้บริการผ่าน OpenRouter และมี ClickHouse หนุนอยู่เบื้องหลัง
เส้นทางนี้เริ่มต้นด้วยการตัดสินใจที่สำคัญที่สุดเมื่อสร้างเอเจนต์ที่ใช้งานจริง: จะใช้โมเดลตัวไหน โมดูล 01 ตอบคำถามนี้ด้วยหลักฐาน — การแข่งขันที่รันเป็น experiment ของ Langfuse และจัดอันดับตามต้นทุนต่อคำตอบที่ถูกต้อง — และทุกโมดูลถัดจากนั้น ก็ต่อยอดจากทางเลือกนี้
ทำตามโมดูลตามลำดับ:
- 00 การตั้งค่า — เชื่อมต่อ OpenRouter, ClickHouse Cloud และ Langfuse Cloud แล้วซีดข้อมูลตั้งต้นลงฐานข้อมูล
- 01 เลือกโมเดลพื้นฐาน — การตัดสินใจพื้นฐาน: รัน grid ของโมเดล × พรอมป์เป็น experiment ของ Langfuse แล้วชี้ตัวผู้ชนะด้วยต้นทุนต่อ คำตอบที่ถูกต้อง
- 02 วัดผลแบบออฟไลน์ — ไปให้ไกลกว่าแค่ "ใครชนะ": อ่านความแม่นยำ
แยกตามระดับ (tier), คะแนน
agent-arena-llm-judge, และ trace แต่ละรายการ เพื่อดูว่าผู้ชนะทำงานจริง ได้ดีแค่ไหน - 03 ปล่อยใช้งานและตรวจจับ — ปล่อยใช้งานคอนฟิกที่เลือก ไว้พร้อมกับนโยบายธุรกิจที่ล้าสมัย จากนั้นดู evaluator เชิงปฏิบัติการผ่านฉลุย ในขณะที่ 👎 ของผู้ใช้จริงเผยให้เห็นจุดบอด
- 04 ตรวจสอบโดยมนุษย์ — ใช้สัญญาณ feedback เพื่อค้นหา trace การผลิตจริงที่เชื่อถือได้ ทำ human annotation ให้เสร็จสมบูรณ์ ตรวจสอบการแก้ไข และบันทึกที่มาของมันไว้
- 05 ปิดวงจรการปรับปรุง — เลื่อนสถานะเคสที่ตรวจสอบแล้ว พิสูจน์การปรับปรุงนโยบายด้วย experiment แบบจับคู่ ปรับแคลิเบรตและเปิดใช้ evaluator แบบออนไลน์ทั่วไป จากนั้นเฝ้าติดตามทราฟฟิกในอนาคตทั้งในแง่คะแนนและ feedback
ดูภาพรวมระดับบนสุดสำหรับตารางโมดูลทั้งหมด รวมถึงบันทึกของเส้นทางผู้สอน ที่คู่กับแต่ละโมดูล