การแข่งที่จัดและตัดสินจบแล้ว
สิบแปดคอนฟิกโมเดล × prompt ที่ให้คะแนนกับคำถามเฉลยทองของคุณ และจัดอันดับด้วย ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ
ClickHouse ซีรีส์ยูสเคส
ใน 90 นาที คุณจัดการแข่งของคุณเอง — หกโมเดลกับสามกลยุทธ์ prompt ตอบคำถามธุรกิจจริงด้วย SQL บน ClickHouse — แล้วเลือกตัวที่จะใช้งานจริงจากหลักฐาน: ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ ไม่ใช่ leaderboard สาธารณะ
ไม่ใช่ leaderboard สาธารณะ แต่เป็นการแข่งของคุณเอง
การเลือกโมเดลคือการตัดสินใจแรกที่มีผลจริงในแอปพลิเคชัน agent และเป็นข้อที่คนเดามากที่สุด เดาสูงไป คุณจ่ายราคาโมเดลระดับแนวหน้าเพื่อความสามารถที่งานนั้นไม่เคยต้องการ เดาต่ำไป คุณส่งของที่ตอบเวิร์กโหลดจริงผิดอย่างเงียบ ๆ
เพราะอย่างนั้นคุณจึงจัดการแข่งด้วยตัวเอง กริดของหกโมเดลกับสามกลยุทธ์ prompt ตอบชุดคำถามธุรกิจที่มีเฉลยจริง บนชุดข้อมูล ClickHouse ที่ใช้งานอยู่
ทุกคำตอบถูกให้คะแนนด้วย ความแม่นยำของการรันจริง — คิวรีคืนผลลัพธ์ที่ถูกหรือไม่ ไม่ใช่ SQL ที่ดูเหมือนจะถูก — และทุกคอนฟิกถูกจัดอันดับด้วย ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ นั่นคือคุณภาพต่อเงินหนึ่งดอลลาร์สำหรับงานของคุณ ซึ่งเป็นตัวเลขเดียวที่ยุติข้อถกเถียงได้จริง
Langfuse ถูกต่อไว้ตั้งแต่โมดูล 00 ไม่ใช่แปะเพิ่มตอนท้าย: มันรันการแข่งเป็น experiment ให้คะแนนด้วย code evaluator และ LLM judge เก็บทุก trace และติดตามผู้ชนะไปจนถึงโปรดักชัน
สิ่งที่คุณจะได้กลับไป
บนบัญชีทดลองใช้ ClickHouse Cloud ของคุณเอง โปรเจกต์ Langfuse ของคุณเอง และคีย์ OpenRouter หนึ่งอัน
สิบแปดคอนฟิกโมเดล × prompt ที่ให้คะแนนกับคำถามเฉลยทองของคุณ และจัดอันดับด้วย ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ
evaluator ตรวจความถูกต้องและ LLM judge ที่รันฝั่งเซิร์ฟเวอร์ในโปรเจกต์ Langfuse ของคุณเอง ให้คะแนนทุกรอบการรัน
คำตอบถูกเทียบกับ ชุดผลลัพธ์ เฉลยทองที่แคชไว้ — ตำแหน่งคอลัมน์ การปัดทศนิยม การนอร์มัลไลซ์ชุดแถว — คิวรีที่ดูเหมือนฟลุกจึงผ่านไม่ได้
คำตอบที่ผ่านการรีวิวกลายเป็นคำถามเฉลยทองใหม่ แล้วกริดรันซ้ำ — เห็นลูปทั้งวง ครบวงจรใน Langfuse
คอนฟิกผู้ชนะรันสดอยู่หลัง POST /ask มี trace แยกตามเซสชัน และผลโหวตนิ้วโป้งขึ้น/นิ้วโป้งลงถูกเขียนกลับเป็นคะแนน Langfuse
harness, agent, ตัวกัน SQL แบบอ่านอย่างเดียว, API สำหรับให้บริการ และ UI ของ arena — เป็นของคุณที่จะชี้ไปที่ ข้อมูลของคุณเอง
เส้นทาง · ลงมือทำ ~90 นาที
หนึ่งสายงาน ตั้งแต่ต้นจนจบ: เลือกโมเดลจากหลักฐาน ทำความเข้าใจมัน ปรับให้ดีขึ้น แล้วเฝ้าดูมันบนโปรดักชัน
ต่อ OpenRouter, ClickHouse Cloud และ Langfuse — วาง tracing ไว้ก่อนเลือกโมเดลใด ๆ — แล้ว seed ชุดข้อมูลของ arena
รันกริดโมเดล × prompt เป็น Langfuse experiment แล้วประกาศผู้ชนะจากต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ
ไปไกลกว่า “มันชนะ”: ความแม่นยำแยกตามระดับ สัญญาณ llm_judge และ trace รายตัวจาก prompt ไปถึง SQL ที่สร้างออกมา
เปลี่ยนคำตอบที่รีวิวแล้วให้เป็นคำถามเฉลยทองใหม่ผ่านคิวการทำ annotation แล้วรันกริดซ้ำกับคำถามชุดนั้น
ให้บริการคอนฟิกผู้ชนะหลัง API จริง แล้วเฝ้าดู trace บนโปรดักชัน เซสชัน ต้นทุน และฟีดแบ็กนิ้วโป้งขึ้น/นิ้วโป้งลง
ค่าเริ่มต้นคือทำเองตามจังหวะของคุณ ทุกโมดูลระบุจุดตรวจเริ่มต้นและจบด้วยการตรวจสอบที่คุณเช็คได้เอง จึงไม่มีใครถูกทิ้งไว้เพราะจังหวะของห้อง
ก่อนเข้าร่วม
เตรียมบัญชีทดลองใช้ ClickHouse Cloud โปรเจกต์ Langfuse และคีย์ OpenRouter มา แล้วกลับไปพร้อมคำตอบว่าจะใช้โมเดลไหน มันมีต้นทุนเท่าไรต่อคำตอบที่ถูกหนึ่งข้อ และจะพิสูจน์ซ้ำได้อย่างไรในไตรมาสหน้า