Langfuse WorkshopClickHouse Workshops

04 Giám sát

Hướng dẫn học viên: 04 Giám sát

Tài liệu hội thảo được duy trì trong kho lưu trữ langfuse/langfuse-workshop công khai. Sử dụng kho lưu trữ cho ứng dụng có thể chạy, nhánh điểm kiểm tra và thiết lập cục bộ.

Xem tệp Markdown này

Hướng dẫn học viên: 04 Giám sát

Ghi chú hướng dẫn viên

  • Đây vẫn là một chương ưu tiên UI, nhưng nó hiện trộn hai loại đánh giá: LLM-as-a-judge cho các tín hiệu ngữ nghĩa và một đánh giá mã cho tín hiệu thất vọng xác định.
  • Đóng bằng gieo hạt: sau khi các màn hình được phát sóng trực tiếp, npm run langfuse:seed:otel:no-scores thả một loạt production giao thông thực tế (incl. ngoài phạm vi, tất cả CAPS và bất đồng ý) vào dự án, và vì các đánh giá đã chạy nó được tính điểm trực tiếp — một khoảng trắng "xem các màn hình phát sáng ở quy mô" tiền lương. Biến thể :no-scores là có chủ đích — điểm số nên đến từ các đánh giá của chính học viên, không phải hạt. Nhắc nhở học viên nó không thể trùng lặp (chạy lại nhân đôi dữ liệu).
  • Trước đánh giá đầu tiên, hãy xác nhận dự án có Cài đặt Dự án → Kết nối LLM được cấu hình. Trên các dự án mới, trình hướng dẫn Thiết lập đánh giá chặn trên bước Thiết lập kết nối LLM cho đến khi mô hình mặc định được lưu — có học viên chọn kết nối OpenAI và một mô hình có khả năng xuất có cấu trúc ở đó.
  • Các mẫu được quản lý sống dưới Sử dụng hiện tại trên trang Thiết lập đánh giá. Học viên nhấp vào Tạo từ đầu → Đánh giá LLM as a judge kết thúc trong một biểu mẫu Tạo đánh giá mới trống và nghĩ các mẫu đã biến mất — làm cho họ đóng hộp thoại và chọn từ danh sách.
  • Giải thích lý do hai màn hình nhắm tới các quan sát khác nhau: ngoài phạm vi cần hệ thống nhắc trên generation, trong khi bất đồng ý cần lịch sử hội thoại trên agent root.
  • Giải thích lý do người theo dõi tất cả CAPS dựa trên mã: không cần cuộc gọi mô hình khi một quy tắc xác định đơn giản là đủ.
  • Sử dụng các kết quả đánh giá đầu tiên làm bài tập gỡ lỗi, không chỉ là kiểm tra pass/fail.

Nhịp độ Demo

  1. Cấu hình Out-of-Scope Request trên các quan sát generation cuối cùng.
  2. Cấu hình User Disagreement trên quan sát dad-it-support-chat-turn agent.
  3. Cấu hình đánh giá mã tất cả CAPS trên quan sát dad-it-support-chat-turn agent tương tự.
  4. Gửi một lần sạch trong phạm vi, một lần ngoài phạm vi, một lần bất đồng ý và một lần tất cả CAPS.
  5. Gieo lưu lượng sản xuất với npm run langfuse:seed:otel:no-scores, sau đó làm mới chế độ Tracing và xem các đánh giá trực tiếp tính điểm cho loạt gieo hạt.

Chú ý

  • Vô tình chọn mẫu sai cho User Disagreement.
  • Coi các khóa API Langfuse từ .env là đủ cho các đánh giá. Đánh giá dựa trên Judge cũng cần kết nối LLM cạnh Langfuse.
  • Ánh xạ last_user_message đến mục bảng tả cuối cùng trên một generation cuối cùng; generations cuối cùng bao gồm các thông báo công cụ sau lần quay người dùng.
  • Đối với tín hiệu tất cả CAPS, ưu tiên phiên bản Python trong tài liệu học viên thay vì chiến đấu với trình chỉnh sửa TypeScript.
  • Học viên giả định điểm tất cả CAPS là bảo đảm tức giận. Khung nó như một tín hiệu triage, không phải là bản phát hành.

Trên trang này

VI