Agent Arena — Taller de Langfuse
Enfrenta varios LLM, corona al ganador de NL→SQL sobre ClickHouse y sigue mejorándolo, con Langfuse instrumentado desde el primer paso.
Te damos la bienvenida al manual de Agent Arena. Agent Arena es una competición directa entre agentes LLM: durante el taller enfrentas varios LLM en una tarea concreta —convertir lenguaje natural en SQL sobre un conjunto de datos de comercio electrónico en ClickHouse— y eliges al ganador mediante pruebas, no con una clasificación pública. Langfuse está conectado desde el primer módulo: ejecuta la competición, mide la calidad del ganador, impulsa la mejora continua y llega hasta producción.
Por qué este taller
Al crear una aplicación seria con agentes, una de las primeras decisiones, y de las más importantes, es qué modelo usar. Los modelos varían mucho en capacidad y precio, y la elección correcta depende de tu tarea, no de una clasificación pública ajena. Adivinar puede hacerte pagar de más por un modelo de frontera que no necesitabas o lanzar uno barato que falla silenciosamente con tu carga real.
La respuesta rigurosa es organizar tu propia competición: ejecutar una cuadrícula de modelos y estrategias de prompt como experimentos de Langfuse sobre tu propio conjunto de datos dorado y dejar que el coste por respuesta correcta —calidad por dólar para tu caso de uso— elija al ganador. Esa decisión sostiene todo lo demás: no tiene sentido medir, mejorar o publicar un agente basado en el modelo equivocado.
El caso de uso es un chatbot NL→SQL con un solo flujo: seleccionar el modelo base → medir offline → publicar y detectar → investigar con una persona → demostrar y monitorizar la mejora. Langfuse conecta cada etapa: el mismo proyecto, trazas, feedback, anotaciones, evaluators y datasets desde el Módulo 00 hasta el ciclo de mejora en producción.
El manual tiene dos itinerarios. El del participante contiene la lección que sigues en la sala. El del instructor acompaña el mismo módulo con tiempos, guion, fallos habituales y recuperación.
Módulos
| # | Participante | Instructor | Resultado |
|---|---|---|---|
| 00 | Configuración | notas | OpenRouter, ClickHouse y Langfuse conectados — Langfuse instrumentado antes de elegir un modelo — y dataset de Agent Arena preparado |
| 01 | Seleccionar el modelo base | notas | Competición ejecutada como experimentos de Langfuse; ganador elegido por coste por respuesta correcta — la decisión fundamental |
| 02 | Medir offline | notas | Calidad del ganador comprendida por pregunta y nivel antes de publicar, mediante evaluators, datasets y trazas de Langfuse |
| 03 | Publicar y detectar | notas | Agente publicado con una carencia conocida de política; el SQL ejecutable supera la evaluación operativa mientras el feedback real señala la respuesta |
| 04 | Investigar | notas | Una persona sigue el feedback negativo hasta la traza autoritativa, diagnostica la política obsoleta, verifica una corrección y registra la procedencia de producción |
| 05 | Cerrar el ciclo | notas | El incidente revisado se convierte en dato dorado; experimentos emparejados demuestran la mejora, se calibra y activa online un evaluator general de políticas y se monitoriza el tráfico futuro |