06 Expériences
Guide du participant : 06 Expériences
Le contenu du workshop est maintenu dans le dépôt public langfuse/langfuse-workshop. Utilisez ce dépôt pour exécuter l’application, accéder aux branches de checkpoint et effectuer la configuration locale.
Guide du participant : 06 Expériences
Notes pour le formateur
- L’idée centrale est la réutilisation : le runner d’expérience appelle le même
runSupportConversation(...)que l’application web. - Comparez la notation déterministe dans le script (
keyword_overlap) et la notation LLM-as-a-judge (correctness). - Confirmez le modèle d’évaluation par défaut avant la configuration de Correctness. Si les participants ne l’ont pas fait pendant la session 4, dirigez-les d’abord vers Project Settings → LLM Connections.
- Soulignez la configuration mixte : le script gère le contrôle déterministe peu coûteux, tandis que Langfuse gère le juge sémantique.
- Gardez une concurrence de un pendant le workshop afin que les traces et le résumé final restent faciles à suivre.
Rythme de la démonstration
- Parcourez les sections numérotées dans
scripts/run-dataset.ts. - Montrez l’évaluateur
keyword_overlapdans le script. - Configurez Correctness comme évaluateur d’exécution de dataset.
- Exécutez
npm run dataset:run. - Ouvrez la table des exécutions, les traces par élément et la vue graphique.
Points d’attention
- La cible de l’évaluateur Correctness. Gardez Run on sur Experiments pour afficher le score dans les lignes et la comparaison des exécutions.
- Demandez aux participants de passer Run on de Observations à Experiments avant toute autre configuration.
- Si aucune exécution n’existe encore, la table de vérification ou l’aperçu du prompt peut être vide. C’est normal avant que
npm run dataset:runne crée la première exécution. - Le mapping de Correctness utilise trois sources différentes :
queryest Input avec$.messages[-1].content,generationest Output sans JsonPath etground_truthest Expected Output avec$.idealAnswer. - Une erreur fréquente consiste à laisser les trois variables sur Input, ce qui fait lire silencieusement des données incorrectes pour chaque champ.
- Les participants qui pensent que le contrôle déterministe doit désormais vivre dans Langfuse. Ce n’est pas nécessaire ; mentionnez la documentation des code evaluators uniquement comme alternative.
- « No default model set » signifie que Langfuse a besoin d’une connexion LLM et d’un modèle d’évaluation par défaut ; modifier
.envne règle pas le problème. - Les résultats asynchrones peuvent être lents ; la console n’affiche que le résumé final. Actualisez Langfuse après l’exécution si
correctnessest toujours en attente.