Agent ArenaClickHouse Workshops
Agent Arena

Agent Arena — Langfuse 实训

让一组 LLM 角逐 ClickHouse 上的自然语言转 SQL 冠军,并持续改进;从第一步起,全程由 Langfuse 提供观测。

欢迎来到 Agent Arena 实训手册。Agent Arena 是一场面向 LLM agent 的正面对决:在这次 实训中,你会把一批 LLM 送进一场竞赛,让它们竞争同一份具体工作—— 在 ClickHouse 支撑的电商数据集上做自然语言转 SQL——然后用证据而不是某个公开榜单 来加冕冠军。Langfuse 从第一个模块起就接入,而不是最后才补上:它主持竞赛、 衡量冠军的质量、驱动持续改进,并一路延伸到生产环境。

为什么要做这场实训

当你着手构建一个正式的 agent 应用时,最早也最关键的决定之一就是 用哪个模型。模型在能力和价格上差异巨大,而最佳选择取决于你 的具体任务——而不是别人的公开榜单。在这里靠猜测,你会在两个方向上吃亏: 为一个你并不需要的前沿模型多花钱,或者上线一个便宜模型,却在你真实的 工作负载上悄悄答错。

严谨的做法是自己跑一场竞赛:把一个模型和 prompt 策略的网格,通过 Langfuse experiments,跑在你自己的黄金数据集上,让每个正确答案的成本—— 也就是你的用例下每美元的质量——来选出冠军。这个决定是后面一切的基础; 如果 agent 用错了模型,衡量、改进或发布它都毫无意义。

本次实训用一个自然语言转 SQL 的聊天机器人把这一切落到实处,只走一条流程: 选出基座模型 → 离线衡量 → 发布并发现问题 → 人工调查 → 证明并监控改进效果。 Langfuse 是把每一步串起来的那条线——从模块 00 到生产改进循环,始终是同一个项目、同一批 trace、反馈、annotation、evaluator 和数据集。

这份手册是双轨的。学员课程是你在现场跟着走的课。讲师配套材料是 同一模块的主持人配套材料:时间安排、讲解脚本、常见故障和重置步骤。

模块

#学员课程讲师配套产出
00环境准备笔记接通 OpenRouter、ClickHouse 和 Langfuse——在选定任何模型之前就把 Langfuse 接好——并初始化 Agent Arena 数据集
01选出基座模型笔记以 Langfuse experiments 的形式跑竞赛;按每个正确答案的成本加冕冠军——这是最基础的决策
02离线衡量笔记借助 Langfuse 的 evaluator、数据集和 trace,在发布前逐题、逐档位理解冠军的质量
03发布并发现问题笔记带着一个已知的策略盲点发布选定的 agent;可执行的 SQL 通过了运维 evaluator,而真实用户反馈却标出了这个答案的问题
04人工调查笔记一位人工评审顺着负面反馈找到那条权威 trace,诊断出过期的策略,验证一次修正,并记录生产环境的溯源信息
05闭合改进循环笔记被复核的事件变成黄金数据;配对 experiment 证明了改进效果,一个通用的策略 evaluator 完成校准并在线启用,未来的流量将持续被监控

本页内容

ZH