一份有明确结论的评测
使用标准问题集评测 18 套模型与提示词组合,并按每个正确答案的成本排名。
ClickHouse 场景系列
在 90 分钟内,让六个模型搭配三种提示策略,用 SQL 回答 ClickHouse 中的真实业务问题。最终不看公开排行榜,而是根据实测的每个正确答案成本,决定哪套方案值得上线。
不迷信公开榜单, 用自己的数据实测。
选择模型,是开发 AI 智能体应用时最早需要做出的关键决策,却也经常只凭感觉。模型选得过强,就会为用不到的能力支付高价;模型能力不足,应用上线后又可能在真实负载下悄悄出错。
因此,你将亲自完成这次评测。六个模型与三种提示策略组成 18 套方案,在实时 ClickHouse 数据集上回答一组有标准答案的业务问题。
每个答案都按执行准确率评分:关键在于查询是否返回正确结果,而不是 SQL 看起来是否合理。随后,再按每个正确答案的成本为各套方案排名。这样就能直接衡量每一美元换来了多少有效结果,用数据结束选型争论。
Langfuse 会从模块 00 开始接入,而不是在最后补装。它把整场评测作为实验运行,通过代码评估器和 LLM 裁判打分,保存每条追踪记录,并继续监控最终上线的方案。
最终成果
所有成果都运行在你自己的 ClickHouse Cloud 试用服务和 Langfuse 项目中,并通过一个 OpenRouter API key 调用模型。
使用标准问题集评测 18 套模型与提示词组合,并按每个正确答案的成本排名。
在自己的 Langfuse 项目中,通过服务端运行的正确性评估器和 LLM 裁判为每次执行评分。
把答案与缓存的标准结果集逐一比对,并处理列顺序、浮点数舍入和行集归一化,避免查询靠巧合蒙混过关。
把人工审核过的答案转为新的标准问题,再重新运行全部组合;整个改进闭环都能在 Langfuse 中完整查看。
将胜出的方案部署到 POST /ask 接口,通过会话进行追踪,并把赞踩反馈写回 Langfuse 作为评分。
评测框架、AI 智能体、只读 SQL 防护、服务 API 和 Arena 界面全部归你,随时可以接入你自己的数据。
课程安排 · 约 90 分钟实操
沿着一条完整主线,用数据选出模型、分析其表现、持续改进,最后部署到生产环境。
连接 OpenRouter、ClickHouse Cloud 和 Langfuse,在选模型前先配置好追踪,再导入 Arena 数据集。
把所有模型与提示词组合作为 Langfuse 实验运行,再按每个正确答案的成本选出最佳方案。
不只看最终排名,还要分析分层准确率、llm_judge 信号,以及从提示词到生成 SQL 的完整单次追踪。
通过标注队列,把人工审核过的答案转为新的标准问题,再重新运行所有组合。
将胜出的配置部署到真实 API,并观察生产环境中的追踪、会话、成本和赞踩反馈。
课程默认支持自主学习。每个模块开头都有检查点,结尾也有可自行完成的验证,即使中途遇到问题,也能重新加入进度。
参加之前