Agent ArenaClickHouse Workshops
Agent Arena

Agent Arena — Langfuse 워크숍

여러 LLM을 경쟁시켜 ClickHouse 기반 NL→SQL의 승자를 뽑고 계속 개선하는 전 과정을 첫 단계부터 Langfuse로 계측합니다.

Agent Arena 플레이북에 오신 것을 환영합니다. Agent Arena는 LLM 에이전트를 위한 맞대결 콘테스트입니다. 이 워크숍을 진행하는 동안 여러 LLM 목록을 하나의 특정 작업을 위한 콘테스트에 투입합니다 — ClickHouse 기반 이커머스 데이터셋을 대상으로 하는 자연어→SQL 변환이며, 공개 리더보드가 아니라 증거를 바탕으로 승자를 결정합니다. Langfuse는 마지막에 덧붙이는 것이 아니라 첫 모듈부터 연결됩니다. 콘테스트를 운영하고, 승자의 품질을 측정하고, 지속적인 개선을 이끌며, 프로덕션까지 이어집니다.

이 워크숍이 필요한 이유

실전 에이전트 애플리케이션을 만들 때 가장 먼저 마주하고 가장 큰 영향을 미치는 결정 중 하나는 어떤 모델을 사용할 것인가입니다. 모델은 성능과 가격 모두에서 크게 차이가 나며, 올바른 선택은 다른 누군가의 공개 리더보드가 아니라 여러분의 특정 작업에 따라 달라집니다. 여기서 추측에 의존하면 둘 중 한 방향으로 손해를 보게 됩니다. 필요하지도 않은 프론티어 모델에 과도한 비용을 지불하거나, 저렴한 모델을 배포했다가 실제 워크로드에서 조용히 오답을 내는 경우입니다.

원칙에 맞는 답은 스스로 콘테스트를 진행하는 것입니다. 모델과 프롬프트 전략의 그리드를 Langfuse **실험(experiments)**을 통해 여러분 자신의 골든 데이터셋에 대해 실행하고, 정답당 비용—즉 여러분의 사용 사례에 맞는 달러당 품질—으로 승자를 뽑습니다. 이 결정은 이후 모든 것이 딛고 서는 토대입니다. 잘못된 모델 위에 세운 에이전트를 측정하거나, 개선하거나, 릴리스하는 것은 의미가 없습니다.

이 워크숍은 NL→SQL 챗봇을 사용 사례로 삼아 이를 구체화하며, 하나의 흐름을 따라갑니다. 기본 모델 선택 → 오프라인 측정 → 릴리스하고 감지 → 사람과 함께 조사 → 개선을 증명하고 모니터링. Langfuse는 이 모든 단계를 하나로 엮는 실입니다. 모듈 00부터 프로덕션 개선 루프까지 동일한 프로젝트, 트레이스, 피드백, 어노테이션, 평가자(evaluator), 데이터셋이 이어집니다.

이 플레이북은 두 갈래로 구성됩니다. 학습자 트랙은 현장에서 따라가는 수업이고, 강사 트랙은 같은 모듈에 대한 진행자용 동반 자료입니다: 타이밍, 진행 대본, 자주 겪는 문제, 초기화 단계.

모듈

#학습자강사결과
00설정노트OpenRouter, ClickHouse, Langfuse가 연결됨 — 모델을 선택하기 전부터 Langfuse가 연동되어 있음 — 그리고 Agent Arena 데이터셋 시딩 완료
01기본 모델 선택하기노트콘테스트를 Langfuse 실험으로 실행; 정답당 비용으로 승자를 결정 — 기초가 되는 결정
02오프라인으로 측정하기노트Langfuse의 평가자, 데이터셋, 트레이스를 사용해 릴리스 전에 질문 단위·티어 단위로 승자의 품질을 이해함
03릴리스하고 감지하기노트알려진 정책 사각지대를 안은 채 선택된 에이전트를 릴리스; 실행 가능한 SQL은 운영 평가자를 통과하지만 실제 사용자 피드백이 문제 답변을 지적함
04사람과 함께 조사하기노트사람이 부정적 피드백을 따라 근본 트레이스를 찾고, 오래된 정책을 진단하고, 수정을 검증하고, 프로덕션 출처를 기록함
05루프 완성하기노트검토된 인시던트가 골든 데이터가 됨; 페어드 실험으로 개선을 증명하고, 범용 정책 평가자를 보정해 온라인으로 활성화하며, 이후 트래픽을 모니터링함

이 페이지의 내용

KO