02 Medir offline
Notas do instrutor para o módulo 02 — tempo, roteiro, falhas comuns e etapas de recuperação.
Guia do facilitador para a lição 02 Medir offline.
Tempo
~15 minutos no total.
- 5 min — precisão por nível e distribuição de resultados na visão detalhada da configuração vencedora no Leaderboard.
- 4 min — pontuação secundária
agent-arena-llm-judgee os pontos em que diverge decorrectness. - 6 min — análise de dois ou três traces individuais do Langfuse para perguntas erradas ou com pontuação baixa.
Roteiro
- Reformule o objetivo: vencer a Arena mostra que uma configuração superou as outras no agregado; este módulo revela como ela vence e onde é mais fraca — como saber não apenas que alguém passou em uma entrevista, mas quais perguntas dominou.
- Diga claramente que o módulo não produz dados novos: tudo já foi registrado por
correctnesse pela pontuaçãoagent-arena-llm-judgeemitida pela definição do evaluatorllm_judgeno Módulo 01. É uma atividade de leitura, não uma nova execução. - Confirme o denominador: o repositório contém 20 perguntas YAML, mas
q019eq020são exemplos few-shot reservados; portanto, o experimento contém 18 itens de dataset pontuados. - Na precisão por nível, mostre que uma configuração pode parecer forte no total e ser instável no nível mais difícil — exatamente o que um número agregado do ranking esconde.
- Na distribuição de resultados, percorra as categorias: SQL rejeitado pelo sandbox, erro do ClickHouse, resultado vazio e conjunto de resultados incorreto. São problemas diferentes, com correções distintas, e não uma única “falha”.
- Sobre
agent-arena-llm-judge: é a versão mais granular da correção binária. Uma configuração pode estar correta pela precisão de execução e ainda gerar SQL que um revisor reprovaria, como uma subconsulta desnecessária ou comparação frágil de datas. Se possível, encontre ao vivo uma divergência entrecorrectnesseagent-arena-llm-judge; é a forma mais clara de mostrar a diferença. - Termine escolhendo duas ou três perguntas erradas ou mal pontuadas e lendo seus traces completos ao vivo — prompt enviado, SQL gerado, erro ou resultado — procurando em voz alta um padrão de formulação, join ou filtro de data que o modelo erra repetidamente. O Módulo 04 reutiliza essa habilidade ao investigar o trace de produção sinalizado por feedback. Leve o
config_idselecionado para o lançamento no Módulo 03.
Falhas comuns
- Evaluators do Langfuse não configurados — não há pontuação
agent-arena-llm-judgeou correctness para sustentar o módulo. Volte ao Módulo 01, corrija o destino/filtro do evaluator e execute uma grade pequena e nova. - Nenhuma resposta errada para analisar — se a vencedora alcançou 100% na grade de demonstração, use as falhas de uma configuração não vencedora; o objetivo é praticar a leitura de traces, não encontrar um defeito específico na vencedora.
- ClickHouse não preparado / harness nunca executado — a visão detalhada do Leaderboard fica vazia. O Módulo 01 não terminou; volte e execute-o novamente.
- Abrir o trace retorna 404 ou o projeto errado — normalmente o navegador está em outro projeto do Langfuse, diferente do definido em
.env, ouLANGFUSE_BASE_URL/chaves não correspondem à conta que executou o harness do Módulo 01.
Etapas de recuperação
- Se a visão detalhada estiver vazia, prepare novamente e execute o subconjunto barato:
scripts/arena.sh up, depoispython -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect. - Use um novo
--run-idpara não haver dúvida sobre quais linhas do Leaderboard e qual experimento do Langfuse estão sendo lidos. - Se apenas o dashboard estiver travado e os experimentos existirem no Langfuse, reinicie os servidores locais sem preparar os dados:
scripts/arena.sh stop && scripts/arena.sh serve. - Se faltavam evaluators, a profundidade deste módulo depende de corrigi-los antes da próxima sessão — não há substituto durante a sessão para as pontuações calculadas no Langfuse.