02 Mesurer hors ligne
Notes formateur du module 02 : timing, fil conducteur, problèmes fréquents et procédures de reprise.
Guide d'animation de la leçon 02 Mesurer hors ligne.
Timing
~15 minutes au total.
- 5 min — précision par niveau et répartition des résultats dans la vue détaillée de la configuration gagnante du Leaderboard.
- 4 min — score secondaire
agent-arena-llm-judgeet points de désaccord aveccorrectness. - 6 min — analyse de deux ou trois traces Langfuse individuelles pour les questions incorrectes ou mal notées.
Fil conducteur
- Reformulez l'objectif : gagner l'Arena montre qu'une configuration a battu les autres globalement ; ce module révèle comment elle gagne et où elle est la plus faible, comme savoir non seulement qu'un candidat a réussi un entretien, mais quelles questions il a maîtrisées.
- Dites clairement que le module ne produit aucune nouvelle donnée : tout a déjà été capturé par
correctnesset par le scoreagent-arena-llm-judgeémis par la définition de l'evaluatorllm_judgeau Module 01. C'est un exercice de lecture, pas une nouvelle exécution. - Confirmez le dénominateur : le dépôt contient 20 questions YAML, mais
q019etq020sont des exemples few-shot réservés ; l'expérience comprend donc 18 éléments de dataset notés. - Sur la précision par niveau, montrez qu'une configuration peut sembler solide globalement tout en étant fragile au niveau le plus difficile : c'est précisément ce que masque un score agrégé du classement.
- Pour la répartition des résultats, parcourez les catégories : SQL rejeté par la sandbox, erreur ClickHouse, résultat vide et jeu de résultats incorrect. Chacune constitue un problème différent avec une correction propre, pas un seul « échec » indifférencié.
- À propos de
agent-arena-llm-judge: c'est le pendant plus fin de la correction binaire. Une configuration peut être correcte selon l'exécution tout en produisant un SQL qu'un relecteur signalerait, comme une sous-requête inutile ou une comparaison de dates fragile. Trouvez si possible un désaccord en direct entrecorrectnessetagent-arena-llm-judge; c'est la meilleure façon d'ancrer la distinction. - Terminez en choisissant deux ou trois questions incorrectes ou mal notées et en lisant leurs traces complètes en direct — prompt envoyé, SQL généré, erreur ou résultat — tout en recherchant à voix haute un motif de formulation, de join ou de filtre de date mal géré. Le Module 04 réutilise cette compétence pour enquêter sur la trace de production signalée par le feedback. Emportez le
config_idchoisi au Module 03.
Problèmes fréquents
- Evaluators Langfuse non configurés — aucun score
agent-arena-llm-judgeou correctness n'est disponible. Revenez au Module 01, corrigez la cible/le filtre de l'evaluator et exécutez une petite grille neuve. - Aucune mauvaise réponse à analyser — si la configuration gagnante obtient 100 % sur la grille de démonstration, choisissez plutôt les échecs d'une configuration non gagnante ; l'objectif est de savoir lire les traces, pas de trouver absolument une faiblesse au gagnant.
- ClickHouse non initialisé / harness jamais exécuté — la vue détaillée du Leaderboard est vide. Le Module 01 n'est pas terminé ; revenez l'exécuter.
- L'ouverture d'une trace renvoie 404 ou charge le mauvais projet — le navigateur pointe généralement vers un autre projet Langfuse que celui de
.env, ouLANGFUSE_BASE_URL/les clés ne correspondent pas au compte ayant exécuté le harness du Module 01.
Procédures de reprise
- Si la vue détaillée est vide, réinitialisez puis relancez le sous-ensemble économique :
scripts/arena.sh up, puispython -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect. - Utilisez un nouveau
--run-idafin d'identifier sans ambiguïté les lignes du Leaderboard et l'expérience Langfuse lues en salle. - Si seul le rendu du dashboard est bloqué et que les expériences existent dans Langfuse, redémarrez les serveurs locaux sans réinitialiser les données :
scripts/arena.sh stop && scripts/arena.sh serve. - Si les evaluators manquaient, la profondeur de ce module dépend de leur correction avant la prochaine session ; aucun substitut en séance ne remplace les scores calculés dans Langfuse.