讲师配套材料
面向主持人的时间安排、讲解脚本、常见故障和重置步骤。
这里是讲师配套材料:学员课程的主持人配套材料。每个模块都对应其学员 课程的相应部分,并补充了时间安排、讲解脚本、常见故障模式和现场运行时的 重置步骤。
整场实训沿着一条连续的主线展开:选出基座模型 → 离线衡量 → 发布并发现问题 → 人工调查 → 证明并监控改进效果。
总时间安排
| 模块 | 学员课程 | 讲师笔记 | 产出 | 预算 |
|---|---|---|---|---|
| 00 | 环境准备 | 笔记 | 接通 OpenRouter、ClickHouse 和 Langfuse;初始化 Agent Arena 数据。 | 20 分钟 |
| 01 | 选出基座模型 | 笔记 | 跑竞赛,按每个正确答案的成本选出一个配置。 | 20 分钟 |
| 02 | 离线衡量 | 笔记 | 在发布前读懂冠军的离线分数和 trace。 | 15 分钟 |
| 03 | 发布并发现问题 | 笔记 | 发布那个过期的策略,捕获 evaluator 通过而用户判定失败的这一冲突。 | 15 分钟 |
| 04 | 人工调查 | 笔记 | 完成一次证据先行的人工诊断,并交接经过修正的输出。 | 20 分钟 |
| 05 | 闭合改进循环 | 笔记 | 扩展黄金数据集,证明修复有效,并启用经过校准的在线防护。 | 25 分钟 |
也就是整场课的动手环节总共 115 分钟——约 1 小时 55 分钟——, 再加上模块之间的过渡时间。
场地准备
- 每位学员(或每对学员)一份
.env,用他们自己的 OpenRouter、Langfuse Cloud 和 ClickHouse Cloud 账号填好——凭据不在学员之间共享,因为模块 00 也会为每个数据种子提供一个专用的、只读的arena_roClickHouse 用户。 - 用投影展示你自己的 Langfuse Cloud 项目(与学员的项目分开),用于在 模块 01–05 中演示 experiment、生产 trace、annotation 和 evaluator。
- 随时可以运行
scripts/arena.sh status的终端——它会报告 dashboard API 和 web UI 是否在运行,并打印每个v_*视图的行数。scripts/arena.sh up会初始化 ClickHouse 业务数据集并启动本地服务;基准测试结果保存在 Langfuse 中(本次实训不涉及 Aurora、ClickPipes 或 ClickStack)。
前置检查清单
在模块 00 开始之前确认以下各项,最好提前一天完成:
- 学员已经创建(或已获得)OpenRouter、Langfuse Cloud 和 ClickHouse Cloud 的账号,并拿到真实的 API 密钥——不是占位值。
- 学员已经克隆好仓库,并能够创建 Python virtualenv
(
python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt)。 - 已安装 Node.js,用于 web 端的 Chat 标签页(
cd web && npm install), 从模块 00(dashboard)开始需要,模块 03(Chat 标签页)再次用到。 - 你已经读过
eval/langfuse_evaluators/README.md——模块 01 里那次性的 Langfuse evaluator 配置是整场课最容易出岔子的一步,值得提前演练。 - 你自己已经在课前完整跑过一遍
source .env && scripts/arena.sh up, 这样当某位学员的运行结果不一致时,你才知道"初始化正确"该是什么样子。