Parcours participant
Les leçons pratiques réalisées pendant la session.
Voici le parcours participant : les leçons pratiques réalisées pendant l'atelier. Chaque module s'appuie sur le précédent et fait progresser le chatbot NL→SQL d'Agent Arena dans un flux unique : sélectionner le modèle de base → mesurer hors ligne → publier et détecter → enquêter avec un humain → prouver et surveiller l'amélioration, le tout instrumenté avec Langfuse dès le premier module, servi via OpenRouter et adossé à ClickHouse.
Le parcours commence par la décision la plus importante pour créer un agent sérieux : quel modèle utiliser. Le Module 01 y répond par des preuves — la compétition exécutée comme expériences Langfuse et classée selon le coût par réponse correcte — puis chaque module s'appuie sur ce choix.
Suivez les modules dans l'ordre :
- 00 Configuration — connectez OpenRouter, ClickHouse Cloud et Langfuse Cloud, puis initialisez la base de données.
- 01 Sélectionner le modèle de base — exécutez la grille modèle × prompt comme expériences Langfuse et couronnez le gagnant selon le coût par réponse correcte.
- 02 Mesurer hors ligne — dépassez le simple constat de victoire : lisez la précision par niveau, le score
agent-arena-llm-judgeet les traces individuelles pour comprendre les performances réelles. - 03 Publier et détecter — publiez la configuration choisie avec une politique métier obsolète, puis observez un evaluator opérationnel réussir tandis que le 👎 d'un utilisateur réel révèle la lacune.
- 04 Enquêter — utilisez le feedback pour trouver la trace de production de référence, compléter une annotation humaine, vérifier la correction et consigner sa provenance.
- 05 Boucler la boucle — promouvez l'incident revu, prouvez l'amélioration de la politique avec des expériences appariées, calibrez et activez un evaluator général en ligne, puis surveillez scores et feedback futurs.
Consultez la présentation pour voir le tableau complet des modules et les notes correspondantes du parcours formateur.