ClickHouse 场景系列

选出最佳方案,
算清真实成本。

在 90 分钟内,让六个模型搭配三种提示策略,用 SQL 回答 ClickHouse 中的真实业务问题。最终不看公开排行榜,而是根据实测的每个正确答案成本,决定哪套方案值得上线。

90 分钟 · 从头到尾18 套方案参与评测Langfuse 从第一步接入$0 试用额度

不迷信公开榜单, 用自己的数据实测。

选择模型,是开发 AI 智能体应用时最早需要做出的关键决策,却也经常只凭感觉。模型选得过强,就会为用不到的能力支付高价;模型能力不足,应用上线后又可能在真实负载下悄悄出错。

因此,你将亲自完成这次评测。六个模型与三种提示策略组成 18 套方案,在实时 ClickHouse 数据集上回答一组有标准答案的业务问题。

每个答案都按执行准确率评分:关键在于查询是否返回正确结果,而不是 SQL 看起来是否合理。随后,再按每个正确答案的成本为各套方案排名。这样就能直接衡量每一美元换来了多少有效结果,用数据结束选型争论。

Langfuse 会从模块 00 开始接入,而不是在最后补装。它把整场评测作为实验运行,通过代码评估器和 LLM 裁判打分,保存每条追踪记录,并继续监控最终上线的方案。

最终成果

完成课程后,你将拥有这些成果。

所有成果都运行在你自己的 ClickHouse Cloud 试用服务和 Langfuse 项目中,并通过一个 OpenRouter API key 调用模型。

01

一份有明确结论的评测

使用标准问题集评测 18 套模型与提示词组合,并按每个正确答案的成本排名。

02

Langfuse 实验和评估器

在自己的 Langfuse 项目中,通过服务端运行的正确性评估器和 LLM 裁判为每次执行评分。

03

经得起验证的评分

把答案与缓存的标准结果集逐一比对,并处理列顺序、浮点数舍入和行集归一化,避免查询靠巧合蒙混过关。

04

一个持续改进闭环

把人工审核过的答案转为新的标准问题,再重新运行全部组合;整个改进闭环都能在 Langfuse 中完整查看。

05

把最佳方案部署上线

将胜出的方案部署到 POST /ask 接口,通过会话进行追踪,并把赞踩反馈写回 Langfuse 作为评分。

+

整个仓库

评测框架、AI 智能体、只读 SQL 防护、服务 API 和 Arena 界面全部归你,随时可以接入你自己的数据。

课程安排 · 约 90 分钟实操

五个环节,循序完成。

沿着一条完整主线,用数据选出模型、分析其表现、持续改进,最后部署到生产环境。

  1. 00

    环境准备

    20 分钟

    连接 OpenRouter、ClickHouse Cloud 和 Langfuse,在选模型前先配置好追踪,再导入 Arena 数据集。

  2. 01

    选定基础模型

    20 分钟

    把所有模型与提示词组合作为 Langfuse 实验运行,再按每个正确答案的成本选出最佳方案。

  3. 02

    衡量质量

    15 分钟

    不只看最终排名,还要分析分层准确率、llm_judge 信号,以及从提示词到生成 SQL 的完整单次追踪。

  4. 03

    持续改进

    20 分钟

    通过标注队列,把人工审核过的答案转为新的标准问题,再重新运行所有组合。

  5. 04

    发布到生产

    15 分钟

    将胜出的配置部署到真实 API,并观察生产环境中的追踪、会话、成本和赞踩反馈。

课程默认支持自主学习。每个模块开头都有检查点,结尾也有可自行完成的验证,即使中途遇到问题,也能重新加入进度。

参加之前

适合哪些人?需要准备什么?

适合谁 适合人群

  • 正准备为某个 agent 功能选模型的工程师和架构师
  • 需要回答 “为什么选择这个模型?”,并希望拿出可靠依据的人
  • 第一次搭建 LLM 评测体系的团队
  • 熟悉 SQL 和终端操作即可,无需机器学习背景

需要带什么 前置准备

  • 笔记本上装好 Python 3.11 和 Node 18+
  • 一个带试用额度的 ClickHouse Cloud 服务
  • 一个 Langfuse Cloud 项目
  • 一个 OpenRouter API key 一个兼容 OpenAI API 的端点即可调用列表中的所有模型,无需分别管理各家凭据

怎么进行 进行方式

  • 五个模块全程动手实践,每条命令和查询都可复制粘贴
  • 可以完全自主学习;同时提供与各模块对应的讲师指南,方便组织者授课
  • 所有评分都在你自己的 Langfuse 项目中运行,数据和结果由你保留
  • 模型列表特意选择了低成本方案,因为自然语言转 SQL 通常不需要最前沿的模型

准备好开始评测了吗?

准备好 ClickHouse Cloud 试用服务、Langfuse 项目和 OpenRouter API key。课程结束时,你会知道该上线哪个模型、每个正确答案的成本是多少,以及今后如何定期重新验证选择。

18一次实验中参与评分的模型与提示词组合数。
$0试用额度和低成本模型足以覆盖整场课程。
归你评测框架完全归你,随时可以替换成自己的问题。
ZH