Agent ArenaClickHouse Workshops

02 품질 측정

모듈 02 진행자 노트 — 타이밍, 토크 트랙, 흔한 실패, 리셋 절차.

학습자 수업 02 품질 측정에 대한 진행자용 안내서입니다.

타이밍

총 ~15분.

  • 5분 — 승리한 구성의 Leaderboard 상세 뷰에서 티어별 정확도와 outcome 분포.
  • 4분 — agent-arena-llm-judge 보조 점수, 그리고 correctness와 엇갈리는 지점.
  • 6분 — 틀렸거나 점수가 낮은 질문의 개별 Langfuse 트레이스 두세 개를 파고들기.

토크 트랙

  • 목표를 다시 프레이밍하세요. Arena에서 이겼다는 것은 어떤 구성이 총합적으로 나머지를 앞섰다는 뜻이고, 이 모듈은 그것이 어떻게 이겼고 어디가 가장 약한지를 다룹니다. 후보자가 면접을 통과했다는 사실만이 아니라 어떤 질문을 완벽히 답했는지 아는 것과 같은 발상입니다.
  • 이 모듈이 새 데이터를 만들지 않는다는 점을 명시하세요. 여기 있는 모든 것은 Module 01에서 correctness와 평가자 정의 llm_judge가 내보낸 점수 agent-arena-llm-judge가 이미 수집한 것입니다. 재실행이 아니라 읽기 연습입니다.
  • 분모를 다시 확인하세요. 저장소 원본에는 YAML 질문이 20개 있지만 q019와 q020은 few-shot holdout이므로, Experiment에는 채점되는 데이터셋 항목이 18개 있습니다.
  • 티어별 정확도에 대해: 어떤 구성이 전체적으로는 강해 보이면서 가장 어려운 티어에서는 흔들릴 수 있고, 그것이 바로 총합 리더보드 수치가 숨기는 것이라는 점을 짚어 주세요.
  • outcome 분포에 대해: 카테고리를 소리 내어 훑으세요 — 샌드박스가 거부한 SQL, ClickHouse 오류, 빈 결과, 잘못된 결과 집합 — 그리고 각각이 하나의 뭉뚱그린 "실패"가 아니라 서로 다른 종류의 문제이며 해결책도 다르다는 것을 말하세요.
  • agent-arena-llm-judge에 대해: 이진 correctness의 더 세밀한 형제입니다. 어떤 구성은 실행 정확도로는 정답이면서도 리뷰어가 여전히 지적할 SQL을 쓸 수 있습니다(불필요한 서브쿼리, 취약한 날짜 비교). 가능하면 correctness와 agent-arena-llm-judge가 엇갈리는 실제 사례를 하나 찾아 보세요. 그 구분을 가장 명확하게 전달하는 방법입니다.
  • 마무리로 틀렸거나 점수가 낮은 질문 두세 개를 골라 그 전체 트레이스를 라이브로 처음부터 끝까지 읽으세요. 보낸 프롬프트, 생성된 SQL, 오류나 결과를 보며 패턴(모델이 계속 잘못 처리하는 표현, 조인, 날짜 필터)을 소리 내어 찾으세요. 이것은 Module 04가 프로덕션 트래픽에 다시 사용하는 같은 트레이스 읽기 기술입니다.

흔한 실패

  • Langfuse 평가자가 설정되지 않음 — 이 모듈을 구성할 agent-arena-llm-judge나 correctness 점수가 없습니다. Module 01로 돌아가 평가자의 target/필터를 고치고, 계속하기 전에 작은 그리드를 새로 실행하세요.
  • 파고들 틀린 답이 없음 — 데모 그리드에서 승리한 구성이 100%를 받았다면, 승리하지 않은 구성의 실패를 대신 고르세요. 요점은 승자에서 흠을 찾는 것이 아니라 트레이스 읽기 기술입니다.
  • ClickHouse가 시딩되지 않음 / 하네스를 실행하지 않음 — Leaderboard 상세 뷰(티어별 정확도, outcome 분포)가 비어 있습니다. Module 01이 끝나지 않았다는 뜻이므로, 계속하기 전에 돌아가 다시 실행하세요.
  • 트레이스로 클릭해 들어가면 404가 나거나 다른 프로젝트가 열림 — 보통 브라우저가 .env의 것과 다른 Langfuse 프로젝트를 가리키고 있거나, LANGFUSE_BASE_URL/키가 Module 01의 하네스를 실행한 계정과 맞지 않다는 뜻입니다.

리셋 절차

  • Leaderboard 상세 뷰가 비어 있다면 다시 시딩하고 저렴한 부분집합을 재실행하세요. scripts/arena.sh up 다음 python -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect.
  • 재실행에는 새 --run-id를 사용해, 강의실에서 어떤 Leaderboard 행과 어떤 Langfuse Experiment를 읽고 있는지 분명하게 하세요.
  • 대시보드 렌더링만 멈춘 경우(Langfuse에 Experiment가 존재한다면) 다시 시딩하지 않고 로컬 서버만 재시작하세요. scripts/arena.sh stop && scripts/arena.sh serve.
  • 평가자가 빠진 부분이었다면, 이 모듈의 깊이는 다음 세션 전에 그것을 고치는 데 달려 있습니다. Langfuse 쪽 점수를 세션 중에 대체할 방법은 없습니다.

이 페이지의 내용

KO