Agent ArenaClickHouse Workshops
Agent Arena

Agent Arena — Atelier Langfuse

Mettez plusieurs LLM en compétition, couronnez le meilleur en NL→SQL sur ClickHouse et continuez à l'améliorer, le tout instrumenté avec Langfuse dès la première étape.

Bienvenue dans le guide Agent Arena. Agent Arena est une compétition directe entre agents LLM : au fil de l'atelier, vous opposez plusieurs LLM sur une tâche précise — transformer le langage naturel en SQL sur un jeu de données e-commerce dans ClickHouse — et désignez le gagnant à partir de preuves, pas d'un classement public. Langfuse est connecté dès le premier module : il exécute la compétition, mesure la qualité du gagnant, pilote l'amélioration continue et l'accompagne jusqu'en production.

Pourquoi cet atelier

Lorsque vous créez une application d'agent sérieuse, l'une des premières décisions — et l'une des plus lourdes de conséquences — est le choix du modèle. Les modèles diffèrent fortement en capacités et en prix, et le bon choix dépend de votre tâche, pas du classement public de quelqu'un d'autre. Une supposition vous conduit soit à surpayer un modèle de pointe inutile, soit à livrer un modèle bon marché qui se trompe silencieusement sur votre charge réelle.

La réponse rigoureuse consiste à organiser vous-même la compétition : exécutez une grille de modèles et de stratégies de prompt comme expériences Langfuse sur votre propre dataset de référence, puis laissez le coût par réponse correcte — la qualité par dollar pour votre cas d'usage — choisir le gagnant. Cette décision fonde tout le reste : mesurer, améliorer ou publier un agent bâti sur le mauvais modèle n'a aucun intérêt.

Le cas d'usage est un chatbot NL→SQL, selon un flux unique : sélectionner le modèle de base → mesurer hors ligne → publier et détecter → enquêter avec un humain → prouver et surveiller l'amélioration. Langfuse relie chaque étape : le même projet, les mêmes traces, feedback, annotations, evaluators et datasets du Module 00 jusqu'à la boucle d'amélioration en production.

Le guide propose deux parcours. Le parcours participant contient la leçon suivie en salle. Le parcours formateur accompagne le même module avec le timing, le fil conducteur, les problèmes fréquents et les procédures de reprise.

Modules

#ParticipantFormateurRésultat
00ConfigurationnotesOpenRouter, ClickHouse et Langfuse connectés — Langfuse instrumenté avant tout choix de modèle — et dataset Agent Arena initialisé
01Sélectionner le modèle de basenotesCompétition exécutée comme expériences Langfuse ; gagnant choisi selon le coût par réponse correcte — la décision fondamentale
02Mesurer hors lignenotesQualité du gagnant comprise par question et par niveau avant publication, grâce aux evaluators, datasets et traces Langfuse
03Publier et détecternotesAgent publié avec une lacune de politique connue ; le SQL exécutable réussit l'évaluation opérationnelle tandis que le feedback réel signale la réponse
04EnquêternotesUn humain suit le feedback négatif jusqu'à la trace de référence, diagnostique la politique obsolète, vérifie une correction et consigne sa provenance de production
05Boucler la bouclenotesL'incident revu devient une donnée de référence ; des expériences appariées prouvent l'amélioration, un evaluator général de politique est calibré et activé en ligne, puis le trafic futur est surveillé

Sur cette page

FR