06 AI SRE
把你的编码助手连接到 ClickStack MCP,让它基于你的遥测数据构建一个 SRE 看板和一个告警。
起点
你位于 build-workshop-v1,无需 checkout。预留约 15 分钟。
前置条件:遥测数据正在流入 ClickStack(模块 05),你的编码助手已能配合 MCP 工作(模块 00)。
为什么
你的 agent 本来就擅长写 SQL。把你的可观测性数据和合适的工具交给它,它就能做 SRE 的工作: 构建一个能揭示应用健康状况的看板,以及一个在出问题时触发的告警。本模块把 agent 接到 ClickStack 上并让它开始干活。
目标
HyperDX 的看板生成器已保存了一个 SRE 看板,并且你的编码助手通过 ClickStack MCP 已针对你的 遥测数据保存了至少一个告警。
第 1 步:验证你的编码助手与 ClickStack 的连接
这里不要再添加新的 MCP 服务器。使用模块 00 中已配置并授权好的 clickstack 连接。让它做一次
端到端调用其工具的健康检查:
Using the clickstack MCP, check the health of the nyc-taxi-backend service over the last 24h — request volume, error rate, and latency — and tell me if anything looks off.
预期结果:一份有据可依的汇总,包含请求量、错误率、延迟和最后活动时间。 如果工具要求你选择一个服务,就选本课程使用的那个 ClickHouse 服务。
第 2 步:使用 HyperDX 看板生成器
产品内置的 HyperDX 看板生成器可以根据一段自然语言描述来构建看板。 它不是你的编码助手。在 ClickStack 中,打开左侧边栏的 Dashboards 并点击 Generate with AI。描述你想要什么, 生成器会先检查你的遥测数据,并根据它实际找到的内容来构建图块 (如果数据中缺少你要求的东西,它会告诉你,而不是凭空造出通用图块):
explore the app's traces and logs, then build and save an SRE dashboard showing request rate, error rate, and p95 latency per service
Dashboards → Generate with AI:描述这个看板,让 HyperDX 检查数据并把它构建出来。
AI 会遍历你的遥测数据,采样 logs 和 traces、检查错误 span,然后组装并验证每个图块, 最后总结它构建了什么,并给出一个打开已保存看板的链接:

生成器让每个图块都基于真实数据,并在保存之前解释它发现了什么。
打开保存好的看板看看结果:按服务划分的请求速率、错误率和 p95 延迟,以及请求/错误总数、
整体 p95、一个日志告警图块,和一个 top endpoints 表格,全部实时读取自
nyc-taxi-backend 服务。

完成后的 SRE 看板,保存在 Dashboards 下,并由实时遥测数据填充。
第 3 步:让你的编码助手添加一个告警
你的编码助手可以保存告警,但它无法创建告警投递到的通知渠道,没有相应的 MCP 工具。 请先在 HyperDX 界面中预先创建一个 webhook:
- 打开你看板中的某个图表,错误率图块是个不错的选择,并点击 它的 Alert 按钮(图块上的铃铛图标)。
- 在告警的通知设置中,选择 Generic Webhook 作为渠道。
- 你需要一个 URL 来指向它。想要一个零配置的一次性端点,可以在另一个标签页打开 webhook.site;它会给你一个唯一的 URL,并实时显示它收到的每个 请求。复制那个 URL 并把它粘贴为 webhook URL。
- 保存。渠道现在已经存在,所以 agent 保存的告警可以指向它,而当告警触发时, 你就能在你的 webhook.site 页面上实时看到 payload 到达。
回到你的编码助手,粘贴这个提示:
Using the clickstack MCP, inspect the nyc-taxi-backend error-rate baseline, choose and
justify a threshold above that baseline, then use clickstack_save_alert to save an alert
named "NYC taxi backend error rate". Evaluate the error rate over a five-minute window
and target the existing Generic Webhook notification channel. Report the saved alert's
name, source, time window, threshold, and notification channel.预期结果:编码助手报告了全部五个已保存的字段。在 HyperDX 中打开 Alerts 并确认它们一致。 如果 MCP 工具无法选中已有的渠道,就在 HyperDX 中把它挂到已保存的告警上并再保存一次。
webhook.site 的 URL 是公开且临时的,用来在课堂上查看告警触发很合适,但不适合任何真实 场景。在生产环境中,你会把告警接到 Slack、PagerDuty 或你自己的端点上。
第 4 步(可选):AI Notebooks:在 HyperDX 内部排查
上面那条「编码助手加 MCP」的路径是在你的编辑器中工作的。ClickStack 还有一个产品内置的 AI 排查界面:AI Notebooks(beta,仅限 Managed ClickStack)。
- 由团队管理员启用一次:HyperDX - Team Settings -> Security Policies -> 打开 Generative AI。之后左侧边栏中会出现一个 Notebooks 入口。
- 打开一个新 notebook,用自然语言提问,例如:"What are the slowest backend operations in the last 30 minutes, and did any of them error?"
- agent 会查询你的 logs、traces 和 metrics,并输出交互式图块,它的推理过程、 它执行的查询、图表和总结。你可以从任何中间图块分叉出一次新的排查, 并在 AI 图块旁边混入手动搜索、时序、表格或 markdown 图块。
同一份遥测数据,两个 AI 界面:MCP 路径从你的编辑器构建出可长期保留的产物(看板、告警); Notebooks 则用于在可观测性产品内部做交互式排查。在模块 07 中,你可以用其中任意一种来诊断 故障。
如何验证你已完成
- HyperDX 中出现了一个已保存的 SRE 看板,其健康信号都已填充数据。
- 存在一个带有合理阈值的已保存告警。
- 你能说清楚在一次故障期间这个看板会是什么样子。
- 可选:存在一个 Notebook,其中有一次自然语言排查及其图块。
小结
你现在有两个清晰的 AI 界面:HyperDX 的生成器在产品内构建看板,而你的编码助手用 MCP 查询 遥测数据并保存告警。当出问题时,你依靠的正是这两样东西。
最终状态
一个由 AI 构建的 SRE 看板和告警已经就位。带着你在这里配置好的编辑器 agent,继续前往 07 测试、失败与修复。