Một cuộc thi, đã chạy và đã có kết luận
Mười tám cấu hình model × prompt được chấm trên bộ câu hỏi vàng của bạn và xếp hạng theo chi phí cho mỗi câu trả lời đúng.
ClickHouse Chuỗi Use-Case
Trong 90 phút bạn tự chạy cuộc thi của mình — sáu model trên ba chiến lược prompt, trả lời các câu hỏi kinh doanh thật bằng SQL trên ClickHouse — rồi chọn thứ đáng triển khai dựa trên bằng chứng: chi phí cho mỗi câu trả lời đúng, không phải một bảng xếp hạng công khai.
Không phải bảng xếp hạng công khai. Cuộc thi của riêng bạn.
Chọn model là quyết định đầu tiên có hệ quả trong một ứng dụng agent, và cũng là quyết định bị đoán mò nhiều nhất. Đoán cao thì bạn trả giá frontier cho năng lực mà bài toán không cần. Đoán thấp thì bạn triển khai một thứ âm thầm làm sai workload thật của mình.
Vậy nên bạn tự chạy cuộc thi. Một lưới sáu model trên ba chiến lược prompt trả lời một bộ câu hỏi kinh doanh đã có đáp án chuẩn, trên một tập dữ liệu ClickHouse đang chạy thật.
Mọi câu trả lời đều được chấm theo độ chính xác khi thực thi — query có trả về kết quả đúng không, chứ không phải SQL trông có vẻ đúng — và mọi cấu hình đều được xếp hạng theo chi phí cho mỗi câu trả lời đúng. Đó là chất lượng trên mỗi đồng cho bài toán của bạn, con số duy nhất thực sự kết thúc được cuộc tranh luận.
Langfuse được nối dây từ module 00, không phải chắp thêm vào lúc cuối: nó chạy cuộc thi dưới dạng experiment, chấm điểm bằng một evaluator viết bằng code và một LLM judge, lưu mọi trace, và theo người thắng vào production.
Bạn ra về với những gì
Trên bản dùng thử ClickHouse Cloud của bạn, project Langfuse của bạn, và một key OpenRouter.
Mười tám cấu hình model × prompt được chấm trên bộ câu hỏi vàng của bạn và xếp hạng theo chi phí cho mỗi câu trả lời đúng.
Một evaluator kiểm tra tính đúng và một LLM judge chạy phía server trong project Langfuse của riêng bạn, cho điểm mọi lượt chạy.
Câu trả lời được so với tập kết quả vàng đã cache — vị trí cột, làm tròn số thực, chuẩn hoá tập dòng — nên một query chỉ ăn may thì không thể qua.
Các câu trả lời đã được duyệt trở thành câu hỏi vàng mới và lưới chạy lại — toàn bộ vòng lặp thấy được từ đầu đến cuối trong Langfuse.
Cấu hình thắng chạy thật đằng sau POST /ask, có trace theo từng session, với thumbs-up/thumbs-down ghi trở lại thành điểm Langfuse.
Harness, agent, lớp chặn SQL chỉ-đọc, API phục vụ và giao diện arena — của bạn để trỏ vào dữ liệu của chính bạn.
Lộ trình · ~90 phút thực hành
Một mạch liền, từ đầu đến cuối: chọn model bằng bằng chứng, hiểu nó, cải thiện nó, rồi quan sát nó trong production.
Kết nối OpenRouter, ClickHouse Cloud và Langfuse — tracing được nối dây trước khi chọn bất kỳ model nào — rồi nạp tập dữ liệu arena.
Chạy lưới model × prompt dưới dạng experiment Langfuse và trao vương miện theo chi phí cho mỗi câu trả lời đúng.
Đi xa hơn “nó thắng”: độ chính xác theo từng tier, tín hiệu llm_judge, và từng trace riêng lẻ từ prompt đến SQL sinh ra.
Biến các câu trả lời đã duyệt thành câu hỏi vàng mới qua annotation queue, rồi chạy lại lưới trên chúng.
Đưa cấu hình thắng ra sau một API thật và quan sát trace production, session, chi phí, cùng phản hồi thumbs-up/thumbs-down.
Mặc định là tự học. Mỗi module nêu checkpoint khởi đầu và kết thúc bằng một phần kiểm chứng bạn tự đối chiếu được, nên không ai bị bỏ lại vì nhịp của cả lớp.
Trước khi tham gia
Mang theo một bản dùng thử ClickHouse Cloud, một project Langfuse, và một key OpenRouter. Ra về với câu trả lời nên triển khai model nào, nó tốn bao nhiêu cho mỗi câu trả lời đúng, và cách chứng minh lại điều đó vào quý sau.