Agent ArenaClickHouse Workshops

학습자 트랙

세션에서 직접 따라 하는 실습 수업입니다.

이곳은 학습자 트랙입니다: 워크숍 동안 직접 손으로 진행하는 실습 수업입니다. 각 모듈은 이전 모듈을 바탕으로 이어지며, Agent Arena NL→SQL 챗봇을 하나의 흐름으로 이끌어갑니다. 기본 모델 선택 → 오프라인 측정 → 릴리스하고 감지 → 사람과 함께 조사 → 개선을 증명하고 모니터링 — 이 모든 과정은 첫 모듈부터 Langfuse로 계측되고, OpenRouter 위에서 서빙되며, ClickHouse가 뒷받침합니다.

이 흐름은 실전 에이전트를 만들 때 가장 중요한 결정에서 시작합니다: 어떤 모델을 사용할 것인가. 모듈 01은 증거로 이 질문에 답합니다 — Langfuse 실험으로 실행되고 정답당 비용으로 순위를 매기는 콘테스트입니다 — 그리고 이후의 모든 모듈은 그 선택을 토대로 쌓입니다.

모듈은 순서대로 진행하세요:

  • 00 설정 — OpenRouter, ClickHouse Cloud, Langfuse Cloud를 연결하고 데이터베이스를 시딩합니다.
  • 01 기본 모델 선택하기 — 기초가 되는 결정: 모델 × 프롬프트 그리드를 Langfuse 실험으로 실행하고 정답당 비용으로 승자를 결정합니다.
  • 02 오프라인으로 측정하기 — "이겼다"에서 한 걸음 더 나아가, 티어별 정확도, agent-arena-llm-judge 점수, 개별 트레이스를 읽어 승자가 실제로 어떻게 동작하는지 확인합니다.
  • 03 릴리스하고 감지하기 — 오래된 비즈니스 정책을 안은 채 선택된 구성을 릴리스한 다음, 운영 평가자는 통과하지만 실제 사용자의 👎가 그 사각지대를 드러내는 상황을 확인합니다.
  • 04 사람과 함께 조사하기 — 피드백 신호를 이용해 근본 프로덕션 트레이스를 찾고, 사람이 어노테이션을 완료하며, 수정을 검증하고, 그 출처를 기록합니다.
  • 05 루프 완성하기 — 검토된 인시던트를 승격시키고, 페어드 실험으로 정책 개선을 증명하며, 범용 온라인 평가자를 보정하고 활성화한 다음, 이후 트래픽의 점수와 피드백을 모두 모니터링합니다.

전체 모듈 표와 각 모듈에 대응하는 강사 트랙 노트는 최상위 개요를 참고하세요.

Track your progress?

Optional. We email a link to confirm your address; progress records once you open it.

Please use your work email address, not a personal one.

Progress tracking also requires accepting the current Terms of Service in Privacy settings.

KO