ClickHouse Serie de casos de uso

Elige al ganador.
Demuestra el coste.

En 90 minutos organizarás tu propia competición: seis modelos con tres estrategias de prompt responden en SQL a preguntas reales de negocio sobre ClickHouse, y decidirás qué desplegar basándote en pruebas —coste por respuesta correcta—, no en una clasificación pública.

90 minutos · de principio a fin18 configuraciones evaluadasLangfuse desde el paso 00 USD con créditos de prueba

No es una clasificación pública. Es tu propia competición.

Elegir un modelo es la primera decisión importante de una aplicación con agentes y la que más veces se toma a ciegas. Apunta demasiado alto y pagarás precios de frontera por una capacidad que la tarea no necesitaba. Apunta demasiado bajo y desplegarás algo que falla silenciosamente con tu carga real.

Por eso organizas la competición tú mismo. Una cuadrícula de seis modelos y tres estrategias de prompt responde a un conjunto de preguntas de negocio con respuestas conocidas sobre un dataset activo de ClickHouse.

Cada respuesta se evalúa por precisión de ejecución —si la consulta devolvió el resultado correcto, no solo un SQL convincente— y cada configuración se ordena por coste por respuesta correcta. Es calidad por dólar para tu tarea, el único número capaz de resolver la discusión.

Langfuse está conectado desde el módulo 00, no añadido al final: ejecuta la competición como experimentos, evalúa con un verificador de código y un juez LLM, guarda cada traza y acompaña al ganador hasta producción.

Qué te llevarás

Todo lo que tendrás en ejecución al terminar.

En tu propia prueba de ClickHouse Cloud, tu proyecto Langfuse y con una clave de OpenRouter.

01

Una competición ejecutada y resuelta

Dieciocho configuraciones de modelo × prompt evaluadas con tus preguntas doradas y ordenadas por coste por respuesta correcta.

02

Experimentos y evaluadores de Langfuse

Un evaluador de corrección y un juez LLM ejecutados en el servidor de tu proyecto Langfuse, puntuando cada ejecución.

03

Una evaluación que puedes defender

Respuestas comparadas con conjuntos de resultados dorados en caché —posición de columnas, redondeo de floats y normalización de filas— para que una consulta aparentemente acertada no pase por suerte.

04

Un ciclo de mejora continua

Las respuestas revisadas se convierten en nuevas preguntas doradas y la cuadrícula vuelve a ejecutarse: el ciclo entero visible de principio a fin en Langfuse.

05

El ganador en producción

La configuración ganadora detrás de POST /ask, trazada por sesión, con votos positivos/negativos escritos como puntuaciones de Langfuse.

+

El repositorio completo

Harness, agente, protección SQL de solo lectura, API de servicio e interfaz de la arena: todo tuyo para conectarlo a tus propios datos.

El recorrido · unos 90 min prácticos

Cinco paradas, en orden.

Un solo flujo de principio a fin: elige un modelo con pruebas, entiéndelo, mejóralo y obsérvalo en producción.

  1. 00

    Configuración

    20 min

    Conecta OpenRouter, ClickHouse Cloud y Langfuse —con trazas antes de elegir modelo— y carga el dataset de la arena.

  2. 01

    Seleccionar el modelo base

    20 min

    Ejecuta la cuadrícula de modelos × prompts como experimentos de Langfuse y elige al ganador por coste por respuesta correcta.

  3. 02

    Medir la calidad

    15 min

    Ve más allá de «ha ganado»: precisión por nivel, señal llm_judge y trazas individuales desde el prompt hasta el SQL generado.

  4. 03

    Mejorar continuamente

    20 min

    Convierte respuestas revisadas en nuevas preguntas doradas mediante la cola de anotación y repite la cuadrícula.

  5. 04

    Publicar en producción

    15 min

    Sirve la configuración ganadora tras una API real y observa trazas, sesiones, costes y votos positivos/negativos en producción.

Autoguiado de forma predeterminada. Cada módulo indica su checkpoint inicial y termina con una comprobación que puedes revisar; nadie queda atrás por el ritmo del aula.

Antes de participar

Para quién es y qué debes traer.

Para quién es público

  • Ingenieros y arquitectos que van a elegir un modelo para una función con agentes
  • Quien haya oído «¿por qué este modelo?» y quiera una respuesta defendible
  • Equipos que crean evaluación de LLM por primera vez
  • Debes sentirte cómodo con SQL y un terminal; no hace falta experiencia en ML

Qué debes traer requisitos

  • Python 3.11 y Node 18+ en tu portátil
  • Un servicio de ClickHouse Cloud con créditos de prueba
  • Un proyecto de Langfuse Cloud
  • Una clave de API de OpenRouter — un endpoint compatible con OpenAI sirve todos los modelos, sin credenciales separadas por proveedor

Cómo funciona formato

  • 100 % práctico en cinco módulos: todos los comandos y consultas se copian y pegan
  • Totalmente autoguiado, con un itinerario de instructor paralelo para facilitadores
  • La evaluación se ejecuta en tu proyecto Langfuse, por lo que conservas las pruebas
  • La selección es deliberadamente económica: NL→SQL no necesita modelos de frontera

¿Listo para organizar la competición?

Trae una prueba de ClickHouse Cloud, un proyecto Langfuse y una clave de OpenRouter. Sal sabiendo qué modelo desplegar, cuánto cuesta cada respuesta correcta y cómo demostrarlo de nuevo el próximo trimestre.

18Configuraciones de modelo × prompt evaluadas en una ejecución.
0 USDLos créditos de prueba y una selección económica cubren la sesión.
TuyoEl harness es tuyo para usarlo con tus propias preguntas.
ES