02 Medir offline
Notas del instructor para el módulo 02: tiempos, guion, fallos habituales y pasos de recuperación.
Guía del facilitador para la lección 02 Medir offline.
Tiempo
~15 minutos en total.
- 5 min — precisión por nivel y desglose de resultados en la vista detallada de la configuración ganadora del Leaderboard.
- 4 min — puntuación secundaria
agent-arena-llm-judgey los puntos donde discrepa decorrectness. - 6 min — análisis de dos o tres trazas individuales de Langfuse para preguntas erróneas o con puntuación baja.
Guion
- Reformula el objetivo: ganar la Arena demuestra que una configuración superó al resto en conjunto; este módulo revela cómo gana y dónde es más débil, igual que saber no solo que alguien superó una entrevista, sino qué preguntas dominó.
- Explica que el módulo no produce datos nuevos: todo fue capturado por
correctnessy por la puntuaciónagent-arena-llm-judgeemitida por la definición del evaluatorllm_judgeen el Módulo 01. Es un ejercicio de lectura, no una nueva ejecución. - Confirma el denominador: el repositorio contiene 20 preguntas YAML, pero
q019yq020son ejemplos few-shot reservados; por tanto, el experimento contiene 18 elementos puntuados. - En la precisión por nivel, señala que una configuración puede parecer sólida en conjunto y ser inestable en el nivel más difícil: justo lo que oculta una cifra agregada del ranking.
- En el desglose de resultados, recorre las categorías: SQL rechazado por el sandbox, error de ClickHouse, resultado vacío y conjunto de resultados incorrecto. Son problemas distintos con soluciones diferentes, no un único «fallo».
- Sobre
agent-arena-llm-judge: es la versión más detallada de la corrección binaria. Una configuración puede ser correcta por precisión de ejecución y aun así escribir SQL que un revisor marcaría, como una subconsulta innecesaria o una comparación frágil de fechas. Si puedes, encuentra en vivo una discrepancia entrecorrectnessyagent-arena-llm-judge; es la forma más clara de mostrar la diferencia. - Termina eligiendo dos o tres preguntas erróneas o con baja puntuación y leyendo sus trazas completas en vivo —prompt enviado, SQL generado, error o resultado— mientras buscas en voz alta un patrón de formulación, join o filtro de fecha que el modelo maneja mal. El Módulo 04 reutiliza esta habilidad para investigar la traza de producción marcada por feedback. Lleva el
config_idseleccionado al Módulo 03.
Fallos habituales
- Evaluators de Langfuse sin configurar — no existe puntuación
agent-arena-llm-judgeni correctness. Vuelve al Módulo 01, corrige el destino/filtro del evaluator y ejecuta una cuadrícula nueva y pequeña. - No hay respuestas erróneas que analizar — si la ganadora logró un 100 % en la cuadrícula de demostración, usa los fallos de una configuración no ganadora; lo importante es leer trazas, no encontrar un defecto concreto en la ganadora.
- ClickHouse no preparado / el harness nunca se ejecutó — la vista detallada del Leaderboard está vacía. El Módulo 01 no terminó; vuelve a ejecutarlo.
- Abrir una traza devuelve 404 o carga otro proyecto — normalmente el navegador apunta a un proyecto de Langfuse distinto al de
.env, oLANGFUSE_BASE_URL/las claves no corresponden a la cuenta que ejecutó el harness del Módulo 01.
Pasos de recuperación
- Si la vista detallada está vacía, prepara de nuevo y ejecuta el subconjunto económico:
scripts/arena.sh up, seguido depython -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect. - Usa un
--run-idnuevo para que quede claro qué filas del Leaderboard y qué experimento de Langfuse estás leyendo. - Si solo está bloqueado el dashboard y los experimentos existen en Langfuse, reinicia los servidores locales sin preparar datos:
scripts/arena.sh stop && scripts/arena.sh serve. - Si faltaban evaluators, la profundidad de este módulo depende de corregirlos antes de la próxima sesión; no hay sustituto durante la sesión para las puntuaciones de Langfuse.