Agent ArenaClickHouse Workshops

讲师配套材料

面向主持人的时间安排、讲解脚本、常见故障和重置步骤。

这里是讲师配套材料:学员课程的主持人配套材料。每个模块都对应其学员 课程的相应部分,并补充了时间安排、讲解脚本、常见故障模式和现场运行时的 重置步骤。

整场实训沿着一条连续的主线展开:选出基座模型 → 离线衡量 → 发布并发现问题 → 人工调查 → 证明并监控改进效果。

总时间安排

模块学员课程讲师笔记产出预算
00环境准备笔记接通 OpenRouter、ClickHouse 和 Langfuse;初始化 Agent Arena 数据。20 分钟
01选出基座模型笔记跑竞赛,按每个正确答案的成本选出一个配置。20 分钟
02离线衡量笔记在发布前读懂冠军的离线分数和 trace。15 分钟
03发布并发现问题笔记发布那个过期的策略,捕获 evaluator 通过而用户判定失败的这一冲突。15 分钟
04人工调查笔记完成一次证据先行的人工诊断,并交接经过修正的输出。20 分钟
05闭合改进循环笔记扩展黄金数据集,证明修复有效,并启用经过校准的在线防护。25 分钟

也就是整场课的动手环节总共 115 分钟——约 1 小时 55 分钟——, 再加上模块之间的过渡时间。

场地准备

  • 每位学员(或每对学员)一份 .env,用他们自己的 OpenRouter、Langfuse Cloud 和 ClickHouse Cloud 账号填好——凭据不在学员之间共享,因为模块 00 也会为每个数据种子提供一个专用的、只读的 arena_ro ClickHouse 用户。
  • 用投影展示你自己的 Langfuse Cloud 项目(与学员的项目分开),用于在 模块 01–05 中演示 experiment、生产 trace、annotation 和 evaluator。
  • 随时可以运行 scripts/arena.sh status 的终端——它会报告 dashboard API 和 web UI 是否在运行,并打印每个 v_* 视图的行数。scripts/arena.sh up 会初始化 ClickHouse 业务数据集并启动本地服务;基准测试结果保存在 Langfuse 中(本次实训不涉及 Aurora、ClickPipes 或 ClickStack)。

前置检查清单

在模块 00 开始之前确认以下各项,最好提前一天完成:

  • 学员已经创建(或已获得)OpenRouter、Langfuse Cloud 和 ClickHouse Cloud 的账号,并拿到真实的 API 密钥——不是占位值。
  • 学员已经克隆好仓库,并能够创建 Python virtualenv (python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt)。
  • 已安装 Node.js,用于 web 端的 Chat 标签页(cd web && npm install), 从模块 00(dashboard)开始需要,模块 03(Chat 标签页)再次用到。
  • 你已经读过 eval/langfuse_evaluators/README.md——模块 01 里那次性的 Langfuse evaluator 配置是整场课最容易出岔子的一步,值得提前演练。
  • 你自己已经在课前完整跑过一遍 source .env && scripts/arena.sh up, 这样当某位学员的运行结果不一致时,你才知道"初始化正确"该是什么样子。

分模块笔记

本页内容

ZH