Agent ArenaClickHouse Workshops

강사 트랙

진행자를 위한 시간 배분, 진행 대본, 흔한 실패, 초기화 단계입니다.

이곳은 강사 트랙입니다: 학습자 트랙에 대응하는 진행자용 동반 자료입니다. 각 모듈은 학습자용 모듈을 그대로 반영하면서 타이밍 가이드, 진행 대본, 자주 겪는 실패 모드, 초기화 단계를 추가로 제공합니다.

이 워크숍은 하나의 연속된 흐름을 따릅니다: 기본 모델 선택 → 오프라인 측정 → 릴리스하고 감지 → 사람과 함께 조사 → 개선을 증명하고 모니터링.

전체 타이밍

모듈학습자 수업강사 노트결과예산
00설정노트OpenRouter, ClickHouse, Langfuse를 연결하고 Agent Arena 데이터를 시딩합니다.20분
01기본 모델 선택하기노트콘테스트를 실행하고 정답당 비용으로 구성을 선택합니다.20분
02오프라인으로 측정하기노트릴리스 전에 승자의 오프라인 점수와 트레이스를 읽습니다.15분
03릴리스하고 감지하기노트오래된 정책을 릴리스하고 평가자-통과/사용자-실패 불일치를 포착합니다.15분
04사람과 함께 조사하기노트증거 우선의 사람 진단과 수정 결과 인계를 완료합니다.20분
05루프 완성하기노트골든 데이터셋을 확장하고, 수정을 증명하며, 보정된 온라인 보호 장치를 활성화합니다.25분

전체 세션의 실습 작업 시간은 115분 — 약 1시간 55분 이며, 모듈 간 전환 시간은 별도입니다.

현장 준비

  • 학습자(또는 짝) 1인당 하나의 .env — 각자의 OpenRouter, Langfuse Cloud, ClickHouse Cloud 계정으로 채워져 있으며, 학습자 간 자격 증명을 공유하지 않습니다. 모듈 00은 각 시드마다 전용 arena_ro 읽기 전용 ClickHouse 사용자도 프로비저닝하기 때문입니다.
  • 학습자 프로젝트와 분리된, 여러분 자신의 Langfuse Cloud 프로젝트를 보여주는 프로젝터 화면 — 모듈 01~05에서 실험, 프로덕션 트레이스, 어노테이션, 평가자 시연에 사용합니다.
  • 언제든 실행할 수 있는 scripts/arena.sh status가 준비된 터미널 — 대시보드 API와 웹 UI가 켜져 있는지 보여주고, 각 v_* 뷰의 행 수를 출력합니다. scripts/arena.sh up은 ClickHouse 비즈니스 데이터셋을 시딩하고 로컬 서비스를 시작합니다. 벤치마크 결과는 Langfuse에 저장되며 (이 워크숍에는 Aurora, ClickPipes, ClickStack이 없습니다).

사전 준비 체크리스트

모듈 00을 시작하기 전, 가능하면 전날에 아래 항목을 모두 확인하세요:

  • 학습자가 OpenRouter, Langfuse Cloud, ClickHouse Cloud 계정을 생성했거나 제공받았고, 실제 API 키를 가지고 있습니다 — 임시 값이 아닙니다.
  • 학습자가 저장소를 클론했고 Python 가상환경을 만들 수 있습니다 (python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt).
  • 웹 Chat 탭을 위한 Node.js가 설치되어 있습니다 (cd web && npm install). 모듈 00 (대시보드)부터 필요하고, 모듈 03(Chat 탭)에서 다시 필요합니다.
  • eval/langfuse_evaluators/README.md를 읽었습니다 — 모듈 01의 일회성 Langfuse 평가자 설정은 전체 세션에서 가장 까다로운 단계이며 미리 연습해볼 가치가 있습니다.
  • 세션 전에 source .env && scripts/arena.sh up을 직접 한 번 처음부터 끝까지 실행해보았습니다. 그래야 학습자의 실행 결과가 다를 때 "제대로 시딩된" 상태가 어떤 모습인지 알 수 있습니다.

모듈별 노트

이 페이지의 내용

KO