Itinerario del participante
Las lecciones prácticas que realizas durante la sesión.
Este es el itinerario del participante: las lecciones prácticas del taller. Cada módulo se apoya en el anterior y lleva el chatbot NL→SQL de Agent Arena por un único flujo: seleccionar el modelo base → medir offline → publicar y detectar → investigar con una persona → demostrar y monitorizar la mejora, todo instrumentado con Langfuse desde el primer módulo, servido mediante OpenRouter y respaldado por ClickHouse.
El recorrido empieza con la decisión más importante al crear un agente serio: qué modelo usar. El Módulo 01 responde con pruebas —la competición ejecutada como experimentos de Langfuse y ordenada por coste por respuesta correcta— y todos los módulos posteriores parten de esa elección.
Completa los módulos en orden:
- 00 Configuración — conecta OpenRouter, ClickHouse Cloud y Langfuse Cloud y prepara la base de datos.
- 01 Seleccionar el modelo base — ejecuta la cuadrícula de modelo × prompt como experimentos de Langfuse y corona al ganador por coste por respuesta correcta.
- 02 Medir offline — ve más allá de «ganó»: lee la precisión por nivel, la puntuación
agent-arena-llm-judgey trazas individuales para comprender su rendimiento real. - 03 Publicar y detectar — publica la configuración seleccionada con una política de negocio obsoleta y observa cómo un evaluator operativo aprueba mientras el 👎 de un usuario real revela la carencia.
- 04 Investigar — usa el feedback para encontrar la traza de producción autoritativa, completar una anotación humana, verificar la corrección y registrar su procedencia.
- 05 Cerrar el ciclo — promueve el incidente revisado, demuestra la mejora de la política con experimentos emparejados, calibra y activa un evaluator online general y monitoriza puntuaciones y feedback futuros.
Consulta la introducción para ver la tabla completa de módulos y las notas correspondientes del instructor.