Langfuse WorkshopClickHouse Workshops

04 监控

学习者指南:04 监控

工作坊资料在公开的 langfuse/langfuse-workshop 仓库中维护。使用该仓库获取可运行的应用、检查点分支和本地设置。

查看此 Markdown 文件

学习者指南:04 监控

讲师笔记

  • 这仍然是一个 UI 优先的章节,但现在混合了两种评估器类型:作为评判的 LLM 对语义信号和一个代码评估器对确定性挫折信号。
  • 以播种结束:在监视器启动后,npm run langfuse:seed:otel:no-scores 下降一批现实 production 流量(包括超出范围、全大写和分歧边缘情况)到项目中,因为评估器已经在运行它实时获得评分 — 一个令人满意的"大规模观看监视器点亮"回报。:no-scores 变体是有意的 — 分数应该来自学习者自己的评估器,而不是种子。提醒学习者这不是幂等的(重新运行会使数据翻倍)。
  • 在第一个评估器之前,确认项目配置了 项目设置 → LLM 连接。在新项目上,设置评估器向导在 设置 LLM 连接步骤上阻止,直到保存默认模型 — 让学习者在那里选择 OpenAI 连接和结构化输出能力模型。
  • 托管的模板位于设置评估器页面上的 使用现有下。学习者点击 从头创建 → LLM 作为评判评估器最终进入空白的创建新评估器表单,认为模板消失了 — 让他们关闭对话框并从列表中选择。
  • 解释为什么两个监视器针对不同的观测:超出范围需要生成上的系统提示词,而分歧需要代理根上的对话历史。
  • 解释为什么全大写监视器是基于代码的:当简单的确定性规则足够时,不需要模型调用。
  • 使用前几个评估器结果作为调试练习,而不仅仅是通过/失败检查。

演示节奏

  1. 在最终生成观测上配置超出范围请求。
  2. 在 dad-it-support-chat-turn 代理观测上配置用户不同意。
  3. 在相同的 dad-it-support-chat-turn 代理观测上配置全大写代码评估器。
  4. 发送一个干净的范围内转向、一个超出范围的转向、一个分歧转向和一个全大写转向。
  5. 使用 npm run langfuse:seed:otel:no-scores 播种生产流量,然后刷新追踪视图并观看实时评估器对播种批次进行评分。

注意事项

  • 意外地为用户分歧选择了错误的模板。
  • 将来自 .env 的 Langfuse API 密钥视为足够用于评估器。作为评判的评估器也需要 Langfuse 端 LLM 连接。
  • 将 last_user_message 映射到最终生成上的最后代码记录项;最终生成包括用户转向后的工具消息。
  • 对于全大写信号,首选学习者文档中的 Python 版本,而不是与 TypeScript 编辑器搏斗。
  • 学习者假设全大写分数是愤怒的保证。将其作为分类信号,而不是判决。

本页内容

ZH