Agent ArenaClickHouse Workshops

02 Medir offline

Notas do instrutor para o módulo 02 — tempo, roteiro, falhas comuns e etapas de recuperação.

Guia do facilitador para a lição 02 Medir offline.

Tempo

~15 minutos no total.

  • 5 min — precisão por nível e distribuição de resultados na visão detalhada da configuração vencedora no Leaderboard.
  • 4 min — pontuação secundária agent-arena-llm-judge e os pontos em que diverge de correctness.
  • 6 min — análise de dois ou três traces individuais do Langfuse para perguntas erradas ou com pontuação baixa.

Roteiro

  • Reformule o objetivo: vencer a Arena mostra que uma configuração superou as outras no agregado; este módulo revela como ela vence e onde é mais fraca — como saber não apenas que alguém passou em uma entrevista, mas quais perguntas dominou.
  • Diga claramente que o módulo não produz dados novos: tudo já foi registrado por correctness e pela pontuação agent-arena-llm-judge emitida pela definição do evaluator llm_judge no Módulo 01. É uma atividade de leitura, não uma nova execução.
  • Confirme o denominador: o repositório contém 20 perguntas YAML, mas q019 e q020 são exemplos few-shot reservados; portanto, o experimento contém 18 itens de dataset pontuados.
  • Na precisão por nível, mostre que uma configuração pode parecer forte no total e ser instável no nível mais difícil — exatamente o que um número agregado do ranking esconde.
  • Na distribuição de resultados, percorra as categorias: SQL rejeitado pelo sandbox, erro do ClickHouse, resultado vazio e conjunto de resultados incorreto. São problemas diferentes, com correções distintas, e não uma única “falha”.
  • Sobre agent-arena-llm-judge: é a versão mais granular da correção binária. Uma configuração pode estar correta pela precisão de execução e ainda gerar SQL que um revisor reprovaria, como uma subconsulta desnecessária ou comparação frágil de datas. Se possível, encontre ao vivo uma divergência entre correctness e agent-arena-llm-judge; é a forma mais clara de mostrar a diferença.
  • Termine escolhendo duas ou três perguntas erradas ou mal pontuadas e lendo seus traces completos ao vivo — prompt enviado, SQL gerado, erro ou resultado — procurando em voz alta um padrão de formulação, join ou filtro de data que o modelo erra repetidamente. O Módulo 04 reutiliza essa habilidade ao investigar o trace de produção sinalizado por feedback. Leve o config_id selecionado para o lançamento no Módulo 03.

Falhas comuns

  • Evaluators do Langfuse não configurados — não há pontuação agent-arena-llm-judge ou correctness para sustentar o módulo. Volte ao Módulo 01, corrija o destino/filtro do evaluator e execute uma grade pequena e nova.
  • Nenhuma resposta errada para analisar — se a vencedora alcançou 100% na grade de demonstração, use as falhas de uma configuração não vencedora; o objetivo é praticar a leitura de traces, não encontrar um defeito específico na vencedora.
  • ClickHouse não preparado / harness nunca executado — a visão detalhada do Leaderboard fica vazia. O Módulo 01 não terminou; volte e execute-o novamente.
  • Abrir o trace retorna 404 ou o projeto errado — normalmente o navegador está em outro projeto do Langfuse, diferente do definido em .env, ou LANGFUSE_BASE_URL/chaves não correspondem à conta que executou o harness do Módulo 01.

Etapas de recuperação

  • Se a visão detalhada estiver vazia, prepare novamente e execute o subconjunto barato: scripts/arena.sh up, depois python -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect.
  • Use um novo --run-id para não haver dúvida sobre quais linhas do Leaderboard e qual experimento do Langfuse estão sendo lidos.
  • Se apenas o dashboard estiver travado e os experimentos existirem no Langfuse, reinicie os servidores locais sem preparar os dados: scripts/arena.sh stop && scripts/arena.sh serve.
  • Se faltavam evaluators, a profundidade deste módulo depende de corrigi-los antes da próxima sessão — não há substituto durante a sessão para as pontuações calculadas no Langfuse.

Nesta página

PT