Agent ArenaClickHouse Workshops

02 Medir offline

Notas del instructor para el módulo 02: tiempos, guion, fallos habituales y pasos de recuperación.

Guía del facilitador para la lección 02 Medir offline.

Tiempo

~15 minutos en total.

  • 5 min — precisión por nivel y desglose de resultados en la vista detallada de la configuración ganadora del Leaderboard.
  • 4 min — puntuación secundaria agent-arena-llm-judge y los puntos donde discrepa de correctness.
  • 6 min — análisis de dos o tres trazas individuales de Langfuse para preguntas erróneas o con puntuación baja.

Guion

  • Reformula el objetivo: ganar la Arena demuestra que una configuración superó al resto en conjunto; este módulo revela cómo gana y dónde es más débil, igual que saber no solo que alguien superó una entrevista, sino qué preguntas dominó.
  • Explica que el módulo no produce datos nuevos: todo fue capturado por correctness y por la puntuación agent-arena-llm-judge emitida por la definición del evaluator llm_judge en el Módulo 01. Es un ejercicio de lectura, no una nueva ejecución.
  • Confirma el denominador: el repositorio contiene 20 preguntas YAML, pero q019 y q020 son ejemplos few-shot reservados; por tanto, el experimento contiene 18 elementos puntuados.
  • En la precisión por nivel, señala que una configuración puede parecer sólida en conjunto y ser inestable en el nivel más difícil: justo lo que oculta una cifra agregada del ranking.
  • En el desglose de resultados, recorre las categorías: SQL rechazado por el sandbox, error de ClickHouse, resultado vacío y conjunto de resultados incorrecto. Son problemas distintos con soluciones diferentes, no un único «fallo».
  • Sobre agent-arena-llm-judge: es la versión más detallada de la corrección binaria. Una configuración puede ser correcta por precisión de ejecución y aun así escribir SQL que un revisor marcaría, como una subconsulta innecesaria o una comparación frágil de fechas. Si puedes, encuentra en vivo una discrepancia entre correctness y agent-arena-llm-judge; es la forma más clara de mostrar la diferencia.
  • Termina eligiendo dos o tres preguntas erróneas o con baja puntuación y leyendo sus trazas completas en vivo —prompt enviado, SQL generado, error o resultado— mientras buscas en voz alta un patrón de formulación, join o filtro de fecha que el modelo maneja mal. El Módulo 04 reutiliza esta habilidad para investigar la traza de producción marcada por feedback. Lleva el config_id seleccionado al Módulo 03.

Fallos habituales

  • Evaluators de Langfuse sin configurar — no existe puntuación agent-arena-llm-judge ni correctness. Vuelve al Módulo 01, corrige el destino/filtro del evaluator y ejecuta una cuadrícula nueva y pequeña.
  • No hay respuestas erróneas que analizar — si la ganadora logró un 100 % en la cuadrícula de demostración, usa los fallos de una configuración no ganadora; lo importante es leer trazas, no encontrar un defecto concreto en la ganadora.
  • ClickHouse no preparado / el harness nunca se ejecutó — la vista detallada del Leaderboard está vacía. El Módulo 01 no terminó; vuelve a ejecutarlo.
  • Abrir una traza devuelve 404 o carga otro proyecto — normalmente el navegador apunta a un proyecto de Langfuse distinto al de .env, o LANGFUSE_BASE_URL/las claves no corresponden a la cuenta que ejecutó el harness del Módulo 01.

Pasos de recuperación

  • Si la vista detallada está vacía, prepara de nuevo y ejecuta el subconjunto económico: scripts/arena.sh up, seguido de python -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect.
  • Usa un --run-id nuevo para que quede claro qué filas del Leaderboard y qué experimento de Langfuse estás leyendo.
  • Si solo está bloqueado el dashboard y los experimentos existen en Langfuse, reinicia los servidores locales sin preparar datos: scripts/arena.sh stop && scripts/arena.sh serve.
  • Si faltaban evaluators, la profundidad de este módulo depende de corregirlos antes de la próxima sesión; no hay sustituto durante la sesión para las puntuaciones de Langfuse.

En esta página

ES