Una competición ejecutada y resuelta
Dieciocho configuraciones de modelo × prompt evaluadas con tus preguntas doradas y ordenadas por coste por respuesta correcta.
ClickHouse Serie de casos de uso
En 90 minutos organizarás tu propia competición: seis modelos con tres estrategias de prompt responden en SQL a preguntas reales de negocio sobre ClickHouse, y decidirás qué desplegar basándote en pruebas —coste por respuesta correcta—, no en una clasificación pública.
No es una clasificación pública. Es tu propia competición.
Elegir un modelo es la primera decisión importante de una aplicación con agentes y la que más veces se toma a ciegas. Apunta demasiado alto y pagarás precios de frontera por una capacidad que la tarea no necesitaba. Apunta demasiado bajo y desplegarás algo que falla silenciosamente con tu carga real.
Por eso organizas la competición tú mismo. Una cuadrícula de seis modelos y tres estrategias de prompt responde a un conjunto de preguntas de negocio con respuestas conocidas sobre un dataset activo de ClickHouse.
Cada respuesta se evalúa por precisión de ejecución —si la consulta devolvió el resultado correcto, no solo un SQL convincente— y cada configuración se ordena por coste por respuesta correcta. Es calidad por dólar para tu tarea, el único número capaz de resolver la discusión.
Langfuse está conectado desde el módulo 00, no añadido al final: ejecuta la competición como experimentos, evalúa con un verificador de código y un juez LLM, guarda cada traza y acompaña al ganador hasta producción.
Qué te llevarás
En tu propia prueba de ClickHouse Cloud, tu proyecto Langfuse y con una clave de OpenRouter.
Dieciocho configuraciones de modelo × prompt evaluadas con tus preguntas doradas y ordenadas por coste por respuesta correcta.
Un evaluador de corrección y un juez LLM ejecutados en el servidor de tu proyecto Langfuse, puntuando cada ejecución.
Respuestas comparadas con conjuntos de resultados dorados en caché —posición de columnas, redondeo de floats y normalización de filas— para que una consulta aparentemente acertada no pase por suerte.
Las respuestas revisadas se convierten en nuevas preguntas doradas y la cuadrícula vuelve a ejecutarse: el ciclo entero visible de principio a fin en Langfuse.
La configuración ganadora detrás de POST /ask, trazada por sesión, con votos positivos/negativos escritos como puntuaciones de Langfuse.
Harness, agente, protección SQL de solo lectura, API de servicio e interfaz de la arena: todo tuyo para conectarlo a tus propios datos.
El recorrido · unos 90 min prácticos
Un solo flujo de principio a fin: elige un modelo con pruebas, entiéndelo, mejóralo y obsérvalo en producción.
Conecta OpenRouter, ClickHouse Cloud y Langfuse —con trazas antes de elegir modelo— y carga el dataset de la arena.
Ejecuta la cuadrícula de modelos × prompts como experimentos de Langfuse y elige al ganador por coste por respuesta correcta.
Ve más allá de «ha ganado»: precisión por nivel, señal llm_judge y trazas individuales desde el prompt hasta el SQL generado.
Convierte respuestas revisadas en nuevas preguntas doradas mediante la cola de anotación y repite la cuadrícula.
Sirve la configuración ganadora tras una API real y observa trazas, sesiones, costes y votos positivos/negativos en producción.
Autoguiado de forma predeterminada. Cada módulo indica su checkpoint inicial y termina con una comprobación que puedes revisar; nadie queda atrás por el ritmo del aula.
Antes de participar
Trae una prueba de ClickHouse Cloud, un proyecto Langfuse y una clave de OpenRouter. Sal sabiendo qué modelo desplegar, cuánto cuesta cada respuesta correcta y cómo demostrarlo de nuevo el próximo trimestre.