Agent ArenaClickHouse Workshops

学员课程

你在实训过程中要动手完成的课程。

这里是学员课程:你在实训期间要动手完成的一系列课程。每个模块都建立在 上一个模块之上,带着 Agent Arena 的自然语言转 SQL 聊天机器人走完一条流程: 选出基座模型 → 离线衡量 → 发布并发现问题 → 人工调查 → 证明并监控改进效果——从第一个模块起就用 Langfuse 全程记录,通过 OpenRouter 提供服务,并由 ClickHouse 支撑数据。

这条主线从构建一个正式 agent 时最重要的那个决定开始:用哪个模型。 模块 01 用证据回答这个问题——竞赛以 Langfuse experiments 的形式跑出来, 按每个正确答案的成本排名——之后的每个模块都建立在这个选择之上。

按顺序完成以下模块:

  • 00 环境准备 —— 接通 OpenRouter、ClickHouse Cloud 和 Langfuse Cloud,并初始化数据库。
  • 01 选出基座模型 —— 最基础的决策:把模型 × prompt 网格以 Langfuse experiments 的形式跑一遍,按每个正确答案的成本 加冕冠军。
  • 02 离线衡量 —— 不止满足于"它赢了": 读懂逐档位准确率、agent-arena-llm-judge 分数和单条 trace,看清冠军到底表现如何。
  • 03 发布并发现问题 —— 带着一个 过期的业务策略发布选定的配置,然后看运维 evaluator 通过的同时,真实 用户的 👎 暴露出这个盲点。
  • 04 人工调查 —— 用反馈信号找到那条 权威的生产 trace,完成一次人工 annotation,验证修正内容,并记录它的 溯源信息。
  • 05 闭合改进循环 —— 晋升被复核的 事件,用配对 experiment 证明策略改进效果,校准并启用一个通用的在线 evaluator,然后持续监控未来流量的 score 和反馈。

完整的模块表以及每个模块对应的讲师配套材料,见顶层 概览。

Track your progress?

Optional. We email a link to confirm your address; progress records once you open it.

Please use your work email address, not a personal one.

Progress tracking also requires accepting the current Terms of Service in Privacy settings.

ZH