06 Thử nghiệm
Hướng dẫn học viên: 06 Thí nghiệm
Tài liệu hội thảo được duy trì trong kho lưu trữ langfuse/langfuse-workshop công khai. Sử dụng kho lưu trữ cho ứng dụng có thể chạy, nhánh điểm kiểm tra và thiết lập cục bộ.
Hướng dẫn học viên: 06 Thí nghiệm
Ghi chú hướng dẫn viên
- Ý tưởng chính là tái sử dụng: người chạy thí nghiệm gọi cùng
runSupportConversation(...)như ứng dụng web. - Tương phản điểm số xác định trong tập lệnh (
keyword_overlap) với điểm số LLM-as-a-judge (correctness). - Xác nhận mô hình đánh giá mặc định trước thiết lập Correctness. Nếu học viên không cấu hình nó trong phiên 4, gửi họ đến Cài đặt Dự án → Kết nối LLM trước.
- Nhấn mạnh thiết lập hỗn hợp: tập lệnh sở hữu kiểm tra xác định rẻ tiền, trong khi Langfuse sở hữu thẩm phán ngữ nghĩa.
- Giữ tính đồng thời ở một cho các hội thảo để traces và tóm tắt lần chạy cuối cùng dễ theo dõi.
Nhịp độ Demo
- Skim các phần được đánh số trong
scripts/run-dataset.ts. - Chỉ ra đánh giá
keyword_overlapbên trong tập lệnh. - Cấu hình đánh giá Correctness như một đánh giá người chạy dataset.
- Chạy
npm run dataset:run. - Mở bảng chạy, traces mỗi mục và chế độ biểu đồ.
Chú ý
- Mục tiêu đánh giá Correctness. Giữ Chạy trên được đặt thành Thí nghiệm nếu bạn muốn điểm số xuất hiện trên các hàng chạy và so sánh lần chạy.
- Có học viên chuyển Chạy trên từ mặc định Quan sát sang Thí nghiệm trước khi họ cấu hình bất cứ điều gì khác.
- Nếu không tồn tại lần chạy thí nghiệm nào, bảng xem lại hoặc xem trước lời nhắc có thể trống. Điều đó được mong đợi trước khi
npm run dataset:runtạo lần chạy đầu tiên. - Ánh xạ đánh giá Correctness sử dụng ba thả xuống nguồn khác nhau:
querylà Đầu vào với$.messages[-1].content,generationlà Đầu ra với không JsonPath vàground_truthlà Đầu ra dự kiến với$.idealAnswer. - Một sai cấu hình phổ biến là để tất cả ba biến trên Đầu vào, điều này im lặng làm cho đánh giá đọc dữ liệu sai cho mỗi trường.
- Học viên giả định kiểm tra xác định phải sống trong Langfuse bây giờ. Nó không; đề cập đến các tài liệu đánh giá mã chỉ là một sự thay thế.
- "Không có mô hình mặc định được đặt" có nghĩa là Langfuse cần một kết nối LLM/mô hình đánh giá mặc định; nó không được sửa bằng cách chỉnh sửa
.env. - Kết quả đánh giá không đồng bộ chậm; bảng điều khiển chỉ hiển thị tóm tắt cuối cùng, vì vậy làm mới Langfuse sau khi lần chạy hoàn thành nếu
correctnessvẫn đang chờ.