Langfuse WorkshopClickHouse Workshops

06 Thử nghiệm

Hướng dẫn học viên: 06 Thí nghiệm

Tài liệu hội thảo được duy trì trong kho lưu trữ langfuse/langfuse-workshop công khai. Sử dụng kho lưu trữ cho ứng dụng có thể chạy, nhánh điểm kiểm tra và thiết lập cục bộ.

Xem tệp Markdown này

Hướng dẫn học viên: 06 Thí nghiệm

Ghi chú hướng dẫn viên

  • Ý tưởng chính là tái sử dụng: người chạy thí nghiệm gọi cùng runSupportConversation(...) như ứng dụng web.
  • Tương phản điểm số xác định trong tập lệnh (keyword_overlap) với điểm số LLM-as-a-judge (correctness).
  • Xác nhận mô hình đánh giá mặc định trước thiết lập Correctness. Nếu học viên không cấu hình nó trong phiên 4, gửi họ đến Cài đặt Dự án → Kết nối LLM trước.
  • Nhấn mạnh thiết lập hỗn hợp: tập lệnh sở hữu kiểm tra xác định rẻ tiền, trong khi Langfuse sở hữu thẩm phán ngữ nghĩa.
  • Giữ tính đồng thời ở một cho các hội thảo để traces và tóm tắt lần chạy cuối cùng dễ theo dõi.

Nhịp độ Demo

  1. Skim các phần được đánh số trong scripts/run-dataset.ts.
  2. Chỉ ra đánh giá keyword_overlap bên trong tập lệnh.
  3. Cấu hình đánh giá Correctness như một đánh giá người chạy dataset.
  4. Chạy npm run dataset:run.
  5. Mở bảng chạy, traces mỗi mục và chế độ biểu đồ.

Chú ý

  • Mục tiêu đánh giá Correctness. Giữ Chạy trên được đặt thành Thí nghiệm nếu bạn muốn điểm số xuất hiện trên các hàng chạy và so sánh lần chạy.
  • Có học viên chuyển Chạy trên từ mặc định Quan sát sang Thí nghiệm trước khi họ cấu hình bất cứ điều gì khác.
  • Nếu không tồn tại lần chạy thí nghiệm nào, bảng xem lại hoặc xem trước lời nhắc có thể trống. Điều đó được mong đợi trước khi npm run dataset:run tạo lần chạy đầu tiên.
  • Ánh xạ đánh giá Correctness sử dụng ba thả xuống nguồn khác nhau: query là Đầu vào với $.messages[-1].content, generation là Đầu ra với không JsonPath và ground_truth là Đầu ra dự kiến với $.idealAnswer.
  • Một sai cấu hình phổ biến là để tất cả ba biến trên Đầu vào, điều này im lặng làm cho đánh giá đọc dữ liệu sai cho mỗi trường.
  • Học viên giả định kiểm tra xác định phải sống trong Langfuse bây giờ. Nó không; đề cập đến các tài liệu đánh giá mã chỉ là một sự thay thế.
  • "Không có mô hình mặc định được đặt" có nghĩa là Langfuse cần một kết nối LLM/mô hình đánh giá mặc định; nó không được sửa bằng cách chỉnh sửa .env.
  • Kết quả đánh giá không đồng bộ chậm; bảng điều khiển chỉ hiển thị tóm tắt cuối cùng, vì vậy làm mới Langfuse sau khi lần chạy hoàn thành nếu correctness vẫn đang chờ.

Trên trang này

VI