ClickHouse Chuỗi Use-Case

Chọn ra người thắng.
Chứng minh chi phí.

Trong 90 phút bạn tự chạy cuộc thi của mình — sáu model trên ba chiến lược prompt, trả lời các câu hỏi kinh doanh thật bằng SQL trên ClickHouse — rồi chọn thứ đáng triển khai dựa trên bằng chứng: chi phí cho mỗi câu trả lời đúng, không phải một bảng xếp hạng công khai.

90 phút · từ đầu đến cuối18 cấu hình được chấmLangfuse từ bước 0$0 với tín dụng dùng thử

Không phải bảng xếp hạng công khai. Cuộc thi của riêng bạn.

Chọn model là quyết định đầu tiên có hệ quả trong một ứng dụng agent, và cũng là quyết định bị đoán mò nhiều nhất. Đoán cao thì bạn trả giá frontier cho năng lực mà bài toán không cần. Đoán thấp thì bạn triển khai một thứ âm thầm làm sai workload thật của mình.

Vậy nên bạn tự chạy cuộc thi. Một lưới sáu model trên ba chiến lược prompt trả lời một bộ câu hỏi kinh doanh đã có đáp án chuẩn, trên một tập dữ liệu ClickHouse đang chạy thật.

Mọi câu trả lời đều được chấm theo độ chính xác khi thực thi — query có trả về kết quả đúng không, chứ không phải SQL trông có vẻ đúng — và mọi cấu hình đều được xếp hạng theo chi phí cho mỗi câu trả lời đúng. Đó là chất lượng trên mỗi đồng cho bài toán của bạn, con số duy nhất thực sự kết thúc được cuộc tranh luận.

Langfuse được nối dây từ module 00, không phải chắp thêm vào lúc cuối: nó chạy cuộc thi dưới dạng experiment, chấm điểm bằng một evaluator viết bằng code và một LLM judge, lưu mọi trace, và theo người thắng vào production.

Bạn ra về với những gì

Tất cả những thứ sẽ chạy được khi kết thúc.

Trên bản dùng thử ClickHouse Cloud của bạn, project Langfuse của bạn, và một key OpenRouter.

01

Một cuộc thi, đã chạy và đã có kết luận

Mười tám cấu hình model × prompt được chấm trên bộ câu hỏi vàng của bạn và xếp hạng theo chi phí cho mỗi câu trả lời đúng.

02

Experiment và evaluator trong Langfuse

Một evaluator kiểm tra tính đúng và một LLM judge chạy phía server trong project Langfuse của riêng bạn, cho điểm mọi lượt chạy.

03

Cách chấm điểm bạn bảo vệ được

Câu trả lời được so với tập kết quả vàng đã cache — vị trí cột, làm tròn số thực, chuẩn hoá tập dòng — nên một query chỉ ăn may thì không thể qua.

04

Một vòng lặp cải tiến liên tục

Các câu trả lời đã được duyệt trở thành câu hỏi vàng mới và lưới chạy lại — toàn bộ vòng lặp thấy được từ đầu đến cuối trong Langfuse.

05

Người thắng trong production

Cấu hình thắng chạy thật đằng sau POST /ask, có trace theo từng session, với thumbs-up/thumbs-down ghi trở lại thành điểm Langfuse.

+

Toàn bộ repo

Harness, agent, lớp chặn SQL chỉ-đọc, API phục vụ và giao diện arena — của bạn để trỏ vào dữ liệu của chính bạn.

Lộ trình · ~90 phút thực hành

Năm chặng, theo thứ tự.

Một mạch liền, từ đầu đến cuối: chọn model bằng bằng chứng, hiểu nó, cải thiện nó, rồi quan sát nó trong production.

  1. 00

    Thiết lập

    20 phút

    Kết nối OpenRouter, ClickHouse Cloud và Langfuse — tracing được nối dây trước khi chọn bất kỳ model nào — rồi nạp tập dữ liệu arena.

  2. 01

    Chọn model nền

    20 phút

    Chạy lưới model × prompt dưới dạng experiment Langfuse và trao vương miện theo chi phí cho mỗi câu trả lời đúng.

  3. 02

    Đo chất lượng

    15 phút

    Đi xa hơn “nó thắng”: độ chính xác theo từng tier, tín hiệu llm_judge, và từng trace riêng lẻ từ prompt đến SQL sinh ra.

  4. 03

    Cải tiến liên tục

    20 phút

    Biến các câu trả lời đã duyệt thành câu hỏi vàng mới qua annotation queue, rồi chạy lại lưới trên chúng.

  5. 04

    Phát hành lên production

    15 phút

    Đưa cấu hình thắng ra sau một API thật và quan sát trace production, session, chi phí, cùng phản hồi thumbs-up/thumbs-down.

Mặc định là tự học. Mỗi module nêu checkpoint khởi đầu và kết thúc bằng một phần kiểm chứng bạn tự đối chiếu được, nên không ai bị bỏ lại vì nhịp của cả lớp.

Trước khi tham gia

Dành cho ai, và cần mang gì.

Dành cho ai đối tượng

  • Engineer và architect sắp phải chọn model cho một tính năng agent
  • Bất cứ ai từng bị hỏi “vì sao chọn model này?” và muốn một câu trả lời bảo vệ được
  • Các đội lần đầu dựng quy trình đánh giá LLM
  • Quen SQL và terminal — không cần nền tảng ML

Cần mang gì yêu cầu

  • Python 3.11 và Node 18+ trên máy bạn
  • Một service ClickHouse Cloud có tín dụng dùng thử
  • Một project Langfuse Cloud
  • Một API key OpenRouter — một endpoint tương thích OpenAI đứng trước toàn bộ danh sách model, nên không phải quản lý credential riêng cho từng nhà cung cấp

Buổi học diễn ra thế nào định dạng

  • 100% thực hành qua năm module — mọi câu lệnh và query đều copy-paste
  • Hoàn toàn tự học, kèm lộ trình giảng viên đối chiếu từng module cho người điều phối
  • Việc chấm điểm chạy trong project Langfuse của bạn, nên bằng chứng vẫn là của bạn
  • Danh sách model được chọn có chi phí thấp một cách có chủ đích — NL→SQL không cần model frontier

Sẵn sàng chạy cuộc thi chưa?

Mang theo một bản dùng thử ClickHouse Cloud, một project Langfuse, và một key OpenRouter. Ra về với câu trả lời nên triển khai model nào, nó tốn bao nhiêu cho mỗi câu trả lời đúng, và cách chứng minh lại điều đó vào quý sau.

18Cấu hình model × prompt được chấm trong một lượt chạy.
$0Tín dụng dùng thử và danh sách model chi phí thấp lo trọn buổi học.
Của bạnHarness là của bạn để trỏ vào câu hỏi của chính bạn.
VI