Langfuse WorkshopClickHouse Workshops

04 모니터링

학습자 가이드: 04 모니터링

워크숍 자료는 공개 langfuse/langfuse-workshop 저장소에서 관리됩니다. 저장소를 사용하여 실행 가능한 앱, 체크포인트 분기, 로컬 설정을 확인하세요.

이 마크다운 파일 보기

학습자 가이드: 04 모니터링

강사 노트

  • 이것은 여전히 UI 우선 장이지만 이제 두 가지 평가자 유형을 혼합합니다: 의미론적 신호에 대한 LLM 판사와 결정론적 좌절 신호에 대한 코드 평가자.
  • 시딩으로 마무리하세요: 모니터가 활성화된 후 npm run langfuse:seed:otel:no-scores은 현실적인 production 트래픽(범위 밖, 모두 대문자, 의견 불일치 엣지 사례 포함)의 배치를 프로젝트에 떨어뜨리고, 평가자가 이미 실행 중이므로 라이브로 점수를 받습니다. 만족스러운 "규모에서 모니터가 켜지는 것을 보기" 보상입니다. :no-scores 변형은 의도적입니다. 점수는 학습자의 자신의 평가자에서 나와야 하고, 시드가 아닙니다. 학습자에게 멱등성이 아니라는 것을 상기시켜 주세요(다시 실행하면 데이터가 두 배가 됩니다).
  • 첫 번째 평가자 이전에 프로젝트에 Project Settings → LLM Connections이 구성되어 있는지 확인하세요. 신선한 프로젝트에서 Set up evaluator 마법사는 기본 모델이 저장될 때까지 Set up LLM connection 단계에서 차단됩니다. 학습자가 거기에서 OpenAI 연결과 구조화된 출력 가능 모델을 선택하도록 하세요.
  • 관리형 템플릿은 Set up evaluator 페이지의 Use existing 아래에 있습니다. 학습자가 Create from scratch → LLM as a judge evaluator를 클릭하면 빈 Create new evaluator 양식에 끝나고 템플릿이 사라졌다고 생각합니다. 대화상자를 닫고 목록에서 선택하도록 하세요.
  • 두 모니터가 다른 관찰을 목표로 하는 이유를 설명하세요: 범위 밖은 생성의 시스템 프롬프트가 필요하고, 의견 불일치는 에이전트 루트의 대화 기록이 필요합니다.
  • 모든 대문자 모니터가 코드 기반인 이유를 설명하세요: 간단한 결정론적 규칙이 충분할 때 모델 호출이 필요하지 않습니다.
  • 첫 번째 평가자 결과를 통과/실패 확인이 아닌 디버깅 연습으로 사용하세요.

데모 리듬

  1. 최종 생성 관찰에 대해 범위 밖의 요청을 구성합니다.
  2. dad-it-support-chat-turn 에이전트 관찰에 대해 사용자 의견 불일치를 구성합니다.
  3. 같은 dad-it-support-chat-turn 에이전트 관찰에 대해 모든 대문자 코드 평가자를 구성합니다.
  4. 한 번의 깨끗한 범위 내 턴, 한 턴의 범위 밖, 한 턴의 의견 불일치, 한 턴의 모든 대문자를 보냅니다.
  5. npm run langfuse:seed:otel:no-scores으로 프로덕션 트래픽을 시드하고 추적 보기를 새로 고치고 라이브 평가자가 시드된 배치에 점수를 매기는 것을 봅니다.

주의할 점

  • 실수로 사용자 의견 불일치에 대해 잘못된 템플릿을 선택합니다.
  • .env의 Langfuse API 키를 평가자로 충분하다고 취급합니다. 판사 기반 평가자도 Langfuse 측 LLM 연결이 필요합니다.
  • last_user_message을 최종 생성의 마지막 성적표 항목에 매핑합니다. 최종 생성에는 사용자 턴 이후 도구 메시지가 포함됩니다.
  • 모든 대문자 신호의 경우 학습자 문서의 Python 버전을 선호하고 TypeScript 편집기와 싸우지 마세요.
  • 학습자가 모든 대문자 점수를 분노의 보증으로 가정합니다. 보수로 프레임하지 않고 판정으로 프레임하세요.

이 페이지의 내용

KO