ClickHouse Série Cas d'usage

Désignez le vainqueur.
Prouvez le coût.

En 90 minutes, vous organisez votre propre concours : six modèles, trois stratégies de prompt et de vraies questions métier auxquelles répondre en SQL sur ClickHouse. Vous choisissez quoi déployer sur preuves — le coût par bonne réponse — et non selon un classement public.

90 minutes · de bout en bout18 configurations évaluéesLangfuse dès l'étape 00 $ avec les crédits d'essai

Pas un classement public. Votre propre concours.

Choisir un modèle est la première décision importante d'une application à agents, et celle que l'on devine le plus souvent. Visez trop haut et vous paierez le prix des modèles de pointe pour une capacité inutile. Visez trop bas et vous déploierez un système qui se trompe discrètement sur votre charge réelle.

Vous organisez donc vous-même le concours. Une grille de six modèles et trois stratégies de prompt répond à des questions métier dont la vérité terrain est connue sur un dataset ClickHouse actif.

Chaque réponse est évaluée par sa précision d'exécution — la requête renvoie-t-elle le bon résultat, pas seulement un SQL convaincant — et chaque configuration est classée par coût par bonne réponse. C'est la qualité par dollar pour votre tâche, le seul chiffre qui tranche vraiment.

Langfuse est connecté dès le module 00, pas ajouté à la fin : il exécute le concours sous forme d'expériences, évalue avec un vérificateur en code et un juge LLM, stocke chaque trace et accompagne le vainqueur en production.

Ce que vous emportez

Tout ce qui fonctionnera à la fin.

Sur votre essai ClickHouse Cloud, dans votre projet Langfuse et avec une clé OpenRouter.

01

Un concours exécuté et tranché

Dix-huit configurations modèle × prompt évaluées sur vos questions de référence et classées par coût par bonne réponse.

02

Expériences et évaluateurs Langfuse

Un évaluateur d'exactitude et un juge LLM exécutés côté serveur dans votre projet Langfuse, pour noter chaque essai.

03

Une évaluation défendable

Des réponses comparées à des jeux de résultats de référence en cache — position des colonnes, arrondi des floats, normalisation des lignes — pour empêcher une requête chanceuse de réussir.

04

Une boucle d'amélioration continue

Les réponses révisées deviennent de nouvelles questions de référence et la grille est relancée — la boucle entière visible de bout en bout dans Langfuse.

05

Le vainqueur en production

La configuration gagnante derrière POST /ask, tracée par session, avec les avis positifs/négatifs enregistrés comme scores Langfuse.

+

Le dépôt complet

Harness, agent, garde SQL en lecture seule, API de service et interface de l'arène — à vous de les connecter à vos propres données.

Le parcours · environ 90 min pratiques

Cinq étapes, dans l'ordre.

Un flux unique de bout en bout : choisissez un modèle sur preuves, comprenez-le, améliorez-le, puis observez-le en production.

  1. 00

    Configuration

    20 min

    Connectez OpenRouter, ClickHouse Cloud et Langfuse — le traçage avant tout choix de modèle — puis chargez le dataset de l'arène.

  2. 01

    Sélectionner le modèle de base

    20 min

    Exécutez la grille modèle × prompt comme expériences Langfuse et désignez un vainqueur par coût par bonne réponse.

  3. 02

    Mesurer la qualité

    15 min

    Allez au-delà de « il a gagné » : précision par niveau, signal llm_judge et traces individuelles du prompt au SQL généré.

  4. 03

    Améliorer en continu

    20 min

    Transformez les réponses révisées en nouvelles questions de référence via la file d'annotation, puis relancez la grille.

  5. 04

    Déployer en production

    15 min

    Servez la configuration gagnante derrière une véritable API et observez traces, sessions, coûts et avis positifs/négatifs en production.

Autonome par défaut. Chaque module indique son checkpoint initial et se termine par un contrôle vérifiable ; personne ne reste bloqué par le rythme de la salle.

Avant de participer

À qui s'adresse l'atelier et que faut-il apporter ?

Public audience

  • Ingénieurs et architectes sur le point de choisir un modèle pour une fonctionnalité à agents
  • Toute personne à qui l'on a demandé « pourquoi ce modèle ? » et qui veut une réponse défendable
  • Équipes mettant en place leur première évaluation de LLM
  • Être à l'aise avec SQL et un terminal — aucune expérience en ML nécessaire

À apporter prérequis

  • Python 3.11 et Node 18+ sur votre ordinateur
  • Un service ClickHouse Cloud avec des crédits d'essai
  • Un projet Langfuse Cloud
  • Une clé API OpenRouter — un endpoint compatible OpenAI couvre tous les modèles, sans identifiants propres à chaque fournisseur

Format déroulé

  • 100 % pratique sur cinq modules — toutes les commandes et requêtes se copient-collent
  • Entièrement autonome, avec un parcours Formateur parallèle à chaque module
  • L'évaluation tourne dans votre projet Langfuse ; les preuves restent à vous
  • La sélection est volontairement économique — le NL→SQL n'exige pas de modèles de pointe

Prêt à organiser le concours ?

Apportez un essai ClickHouse Cloud, un projet Langfuse et une clé OpenRouter. Repartez en sachant quel modèle déployer, son coût par bonne réponse et comment le prouver à nouveau au prochain trimestre.

18Configurations modèle × prompt évaluées en une exécution.
0 $Les crédits d'essai et une sélection économique couvrent la session.
À vousLe harness vous appartient pour vos propres questions.
FR