06 AI SRE
เชื่อม coding agent ของคุณเข้ากับ ClickStack MCP และให้มันสร้างแดชบอร์ด SRE และการแจ้งเตือนบน telemetry ของคุณ
จุดเริ่มต้น
คุณอยู่บน build-workshop-v1 — ไม่ต้อง checkout ตั้งงบเวลาประมาณ 15 นาที
ข้อกำหนดเบื้องต้น: telemetry ไหลเข้า ClickStack แล้ว (โมดูล 05) และ coding agent ของคุณ ทำงานได้พร้อมการรองรับ MCP (โมดูล 00)
ทำไม
agent ของคุณเขียน SQL เก่งอยู่แล้ว ให้ข้อมูล observability และเครื่องมือที่เหมาะสมกับมัน แล้วมันจะทำงาน SRE ได้: สร้างแดชบอร์ดที่เผยสุขภาพของแอปและ การแจ้งเตือนที่ทำงานเมื่อมีอะไรผิดพลาด โมดูลนี้ต่อสาย agent เข้ากับ ClickStack และให้มันลงมือทำงาน
เป้าหมาย
ตัวสร้างแดชบอร์ดของ HyperDX ได้บันทึกแดชบอร์ด SRE ไว้ และ coding agent ของคุณ ที่เชื่อมต่อผ่าน ClickStack MCP ได้บันทึกการแจ้งเตือนอย่างน้อยหนึ่งรายการบน telemetry ของคุณ
ขั้นที่ 1 — ตรวจสอบการเชื่อมต่อ ClickStack ของ coding agent คุณ
ห้ามเพิ่มเซิร์ฟเวอร์ MCP อีกตัวที่นี่ ใช้การเชื่อมต่อ clickstack ที่ตั้งค่าและ
อนุญาตไว้แล้วในโมดูล 00 ขอให้มันตรวจสุขภาพในแบบที่ใช้เครื่องมือของมันครบวงจร:
Using the clickstack MCP, check the health of the nyc-taxi-backend service over the last 24h — request volume, error rate, and latency — and tell me if anything looks off.
คาดหวัง: สรุปที่มีที่มาชัดเจนพร้อมปริมาณคำขอ อัตราข้อผิดพลาด latency และกิจกรรมล่าสุด ถ้าเครื่องมือถามหาเซอร์วิส ให้เลือกเซอร์วิส ClickHouse ที่เวิร์กช็อปนี้ใช้
ขั้นที่ 2 — ใช้ตัวสร้างแดชบอร์ดของ HyperDX
ตัวสร้างแดชบอร์ดของ HyperDX ที่มีอยู่ในผลิตภัณฑ์สร้างแดชบอร์ดจากคำอธิบายภาษาปกติได้ นี่ไม่ใช่ coding agent ของคุณ ใน ClickStack ให้เปิด Dashboards ในแถบด้านซ้ายแล้วคลิก Generate with AI อธิบายสิ่งที่คุณต้องการ — ตัวสร้างจะตรวจ telemetry ของคุณก่อนและสร้าง tile จากสิ่งที่มันเจอจริง (ถ้าข้อมูลไม่มีสิ่งที่คุณขอ มันจะบอกคุณ ไม่ใช่แต่งขึ้นมาเป็น tile ทั่ว ๆ ไป):
explore the app's traces and logs, then build and save an SRE dashboard showing request rate, error rate, and p95 latency per service
Dashboards → Generate with AI: อธิบายแดชบอร์ดและให้ HyperDX ตรวจข้อมูลและสร้างมันขึ้นมา
AI จะไล่ผ่าน telemetry ของคุณ — สุ่มตัวอย่าง log และ trace ตรวจหา span ที่มีข้อผิดพลาด แล้วประกอบและตรวจสอบแต่ละ tile — และสรุปสิ่งที่มันสร้าง พร้อมลิงก์ให้เปิด แดชบอร์ดที่บันทึกไว้:

ตัวสร้างวางทุก tile บนข้อมูลจริงและอธิบายสิ่งที่มันพบก่อนบันทึก
เปิดแดชบอร์ดที่บันทึกไว้เพื่อดูผลลัพธ์: อัตราคำขอ อัตราข้อผิดพลาด และ latency p95 ต่อ
เซอร์วิส พร้อมจำนวนคำขอ/ข้อผิดพลาดทั้งหมด p95 โดยรวม tile คำเตือนจาก log และ
ตาราง top endpoint — ทั้งหมดอ่านสด ๆ จากเซอร์วิส nyc-taxi-backend

แดชบอร์ด SRE ที่เสร็จแล้ว บันทึกไว้ใต้ Dashboards และมีข้อมูลจาก telemetry สด
ขั้นที่ 3 — ให้ coding agent ของคุณเพิ่มการแจ้งเตือน
coding agent ของคุณบันทึกการแจ้งเตือนได้ แต่สร้างช่องทางแจ้งเตือนที่การแจ้งเตือนนั้น ส่งไปไม่ได้ — ไม่มีเครื่องมือ MCP สำหรับสิ่งนั้น ให้สร้าง webhook ใน UI ของ HyperDX ไว้ก่อน:
- เปิดกราฟหนึ่งอันในแดชบอร์ดของคุณ — tile อัตราข้อผิดพลาดเป็นตัวเลือกที่ดี — แล้วคลิก ปุ่ม Alert ของมัน (ไอคอนกระดิ่งบน tile)
- ในการตั้งค่าการแจ้งเตือนของ alert ให้เลือก Generic Webhook เป็นช่องทาง
- คุณต้องมี URL ให้มันชี้ไป สำหรับเอนด์พอยต์แบบใช้แล้วทิ้งที่ไม่ต้องตั้งค่าอะไร ให้เปิด webhook.site ในแท็บอื่น มันจะให้ URL ที่ไม่ซ้ำกับคุณและ แสดงทุกคำขอที่ได้รับแบบเรียลไทม์ คัดลอก URL นั้นมาวางเป็น URL ของ webhook
- บันทึก ตอนนี้ช่องทางมีอยู่แล้ว การแจ้งเตือนที่ agent บันทึกจึงยิงไปที่มันได้ — และเมื่อ การแจ้งเตือนทำงาน คุณจะดู payload มาถึงแบบสดบนหน้า webhook.site ของคุณได้
กลับไปที่ coding agent ของคุณและวาง prompt นี้:
Using the clickstack MCP, inspect the nyc-taxi-backend error-rate baseline, choose and
justify a threshold above that baseline, then use clickstack_save_alert to save an alert
named "NYC taxi backend error rate". Evaluate the error rate over a five-minute window
and target the existing Generic Webhook notification channel. Report the saved alert's
name, source, time window, threshold, and notification channel.คาดหวัง: coding agent รายงานฟิลด์ที่บันทึกไว้ทั้งห้า เปิด Alerts ใน HyperDX แล้ว ยืนยันว่าตรงกัน ถ้าเครื่องมือ MCP เลือกช่องทางที่มีอยู่ไม่ได้ ให้ผูกมันเข้ากับ การแจ้งเตือนที่บันทึกไว้ใน HyperDX แล้วบันทึกอีกครั้ง
URL ของ webhook.site เป็นสาธารณะและชั่วคราว — เหมาะกับการดูการแจ้งเตือนทำงานใน เวิร์กช็อป แต่ไม่เหมาะกับอะไรที่จริงจัง ในโปรดักชันคุณจะต่อการแจ้งเตือนเข้ากับ Slack, PagerDuty หรือเอนด์พอยต์ของคุณเองแทน
ขั้นที่ 4 (ตัวเลือก) — AI Notebooks: สืบหาปัญหาภายใน HyperDX
เส้นทาง coding agent บวก MCP ด้านบนทำงานจากเอดิเตอร์ของคุณ ClickStack ยังมี พื้นที่สืบหาปัญหาด้วย AI ในผลิตภัณฑ์: AI Notebooks (เบต้า เฉพาะ Managed ClickStack)
- แอดมินของทีมเปิดใช้ครั้งเดียว: HyperDX - Team Settings -> Security Policies -> เปิด Generative AI แล้วรายการ Notebooks จะปรากฏในแถบด้านซ้าย
- เปิด notebook ใหม่และถามด้วยภาษาปกติ ตัวอย่าง: "What are the slowest backend operations in the last 30 minutes, and did any of them error?"
- agent จะคิวรี log, trace และ metric ของคุณ และปล่อย tile แบบโต้ตอบออกมา — การให้เหตุผล ของมัน คิวรีที่มันรัน กราฟ และสรุป คุณแตกกิ่ง การสืบหาจาก tile กลาง ๆ อันไหนก็ได้ และผสม tile แบบค้นหาเอง timeseries ตาราง หรือ markdown ไว้ข้าง ๆ tile ของ AI ได้
telemetry ชุดเดียวกัน พื้นที่ AI สองแบบ: เส้นทาง MCP สร้าง artifact ที่คงทน (แดชบอร์ด การแจ้งเตือน) จากเอดิเตอร์ของคุณ ส่วน Notebooks มีไว้สืบหาปัญหาแบบโต้ตอบภายใน ผลิตภัณฑ์ observability เอง ในโมดูล 07 คุณวินิจฉัยความผิดพลาดด้วยอันไหนก็ได้
วิธีตรวจสอบว่าคุณทำเสร็จ
- แดชบอร์ด SRE ที่บันทึกไว้ปรากฏใน HyperDX พร้อมสัญญาณสุขภาพที่มีข้อมูล
- มีการแจ้งเตือนที่บันทึกไว้พร้อมค่าขีดแบ่งที่สมเหตุสมผล
- คุณอธิบายได้ว่าแดชบอร์ดจะมีหน้าตาอย่างไรตอนเกิดเหตุการณ์
- ตัวเลือก: มี Notebook ที่มีการสืบหาปัญหาด้วยภาษาปกติหนึ่งครั้งพร้อม tile ของมัน
สรุปปิดท้าย
ตอนนี้คุณมีพื้นที่ AI สองแบบที่ชัดเจน: ตัวสร้างของ HyperDX สร้างแดชบอร์ดในผลิตภัณฑ์ ขณะที่ coding agent ของคุณใช้ MCP คิวรี telemetry และบันทึกการแจ้งเตือน นั่นคือสิ่งที่ คุณจะพึ่งพาพอดีเมื่อมีอะไรพัง
สถานะปลายทาง
แดชบอร์ดและการแจ้งเตือน SRE ที่ AI สร้างพร้อมแล้ว ไปต่อที่ 07 ทดสอบ ล้มเหลว และแก้ไข ด้วย agent ในเอดิเตอร์ที่คุณ ตั้งค่าไว้ที่นี่