Un concours exécuté et tranché
Dix-huit configurations modèle × prompt évaluées sur vos questions de référence et classées par coût par bonne réponse.
ClickHouse Série Cas d'usage
En 90 minutes, vous organisez votre propre concours : six modèles, trois stratégies de prompt et de vraies questions métier auxquelles répondre en SQL sur ClickHouse. Vous choisissez quoi déployer sur preuves — le coût par bonne réponse — et non selon un classement public.
Pas un classement public. Votre propre concours.
Choisir un modèle est la première décision importante d'une application à agents, et celle que l'on devine le plus souvent. Visez trop haut et vous paierez le prix des modèles de pointe pour une capacité inutile. Visez trop bas et vous déploierez un système qui se trompe discrètement sur votre charge réelle.
Vous organisez donc vous-même le concours. Une grille de six modèles et trois stratégies de prompt répond à des questions métier dont la vérité terrain est connue sur un dataset ClickHouse actif.
Chaque réponse est évaluée par sa précision d'exécution — la requête renvoie-t-elle le bon résultat, pas seulement un SQL convaincant — et chaque configuration est classée par coût par bonne réponse. C'est la qualité par dollar pour votre tâche, le seul chiffre qui tranche vraiment.
Langfuse est connecté dès le module 00, pas ajouté à la fin : il exécute le concours sous forme d'expériences, évalue avec un vérificateur en code et un juge LLM, stocke chaque trace et accompagne le vainqueur en production.
Ce que vous emportez
Sur votre essai ClickHouse Cloud, dans votre projet Langfuse et avec une clé OpenRouter.
Dix-huit configurations modèle × prompt évaluées sur vos questions de référence et classées par coût par bonne réponse.
Un évaluateur d'exactitude et un juge LLM exécutés côté serveur dans votre projet Langfuse, pour noter chaque essai.
Des réponses comparées à des jeux de résultats de référence en cache — position des colonnes, arrondi des floats, normalisation des lignes — pour empêcher une requête chanceuse de réussir.
Les réponses révisées deviennent de nouvelles questions de référence et la grille est relancée — la boucle entière visible de bout en bout dans Langfuse.
La configuration gagnante derrière POST /ask, tracée par session, avec les avis positifs/négatifs enregistrés comme scores Langfuse.
Harness, agent, garde SQL en lecture seule, API de service et interface de l'arène — à vous de les connecter à vos propres données.
Le parcours · environ 90 min pratiques
Un flux unique de bout en bout : choisissez un modèle sur preuves, comprenez-le, améliorez-le, puis observez-le en production.
Connectez OpenRouter, ClickHouse Cloud et Langfuse — le traçage avant tout choix de modèle — puis chargez le dataset de l'arène.
Exécutez la grille modèle × prompt comme expériences Langfuse et désignez un vainqueur par coût par bonne réponse.
Allez au-delà de « il a gagné » : précision par niveau, signal llm_judge et traces individuelles du prompt au SQL généré.
Transformez les réponses révisées en nouvelles questions de référence via la file d'annotation, puis relancez la grille.
Servez la configuration gagnante derrière une véritable API et observez traces, sessions, coûts et avis positifs/négatifs en production.
Autonome par défaut. Chaque module indique son checkpoint initial et se termine par un contrôle vérifiable ; personne ne reste bloqué par le rythme de la salle.
Avant de participer
Apportez un essai ClickHouse Cloud, un projet Langfuse et une clé OpenRouter. Repartez en sachant quel modèle déployer, son coût par bonne réponse et comment le prouver à nouveau au prochain trimestre.