Langfuse WorkshopClickHouse Workshops

06 Expériences

Guide du participant : 06 Expériences

Le contenu du workshop est maintenu dans le dépôt public langfuse/langfuse-workshop. Utilisez ce dépôt pour exécuter l’application, accéder aux branches de checkpoint et effectuer la configuration locale.

Afficher ce fichier Markdown

Guide du participant : 06 Expériences

Notes pour le formateur

  • L’idée centrale est la réutilisation : le runner d’expérience appelle le même runSupportConversation(...) que l’application web.
  • Comparez la notation déterministe dans le script (keyword_overlap) et la notation LLM-as-a-judge (correctness).
  • Confirmez le modèle d’évaluation par défaut avant la configuration de Correctness. Si les participants ne l’ont pas fait pendant la session 4, dirigez-les d’abord vers Project Settings → LLM Connections.
  • Soulignez la configuration mixte : le script gère le contrôle déterministe peu coûteux, tandis que Langfuse gère le juge sémantique.
  • Gardez une concurrence de un pendant le workshop afin que les traces et le résumé final restent faciles à suivre.

Rythme de la démonstration

  1. Parcourez les sections numérotées dans scripts/run-dataset.ts.
  2. Montrez l’évaluateur keyword_overlap dans le script.
  3. Configurez Correctness comme évaluateur d’exécution de dataset.
  4. Exécutez npm run dataset:run.
  5. Ouvrez la table des exécutions, les traces par élément et la vue graphique.

Points d’attention

  • La cible de l’évaluateur Correctness. Gardez Run on sur Experiments pour afficher le score dans les lignes et la comparaison des exécutions.
  • Demandez aux participants de passer Run on de Observations à Experiments avant toute autre configuration.
  • Si aucune exécution n’existe encore, la table de vérification ou l’aperçu du prompt peut être vide. C’est normal avant que npm run dataset:run ne crée la première exécution.
  • Le mapping de Correctness utilise trois sources différentes : query est Input avec $.messages[-1].content, generation est Output sans JsonPath et ground_truth est Expected Output avec $.idealAnswer.
  • Une erreur fréquente consiste à laisser les trois variables sur Input, ce qui fait lire silencieusement des données incorrectes pour chaque champ.
  • Les participants qui pensent que le contrôle déterministe doit désormais vivre dans Langfuse. Ce n’est pas nécessaire ; mentionnez la documentation des code evaluators uniquement comme alternative.
  • « No default model set » signifie que Langfuse a besoin d’une connexion LLM et d’un modèle d’évaluation par défaut ; modifier .env ne règle pas le problème.
  • Les résultats asynchrones peuvent être lents ; la console n’affiche que le résumé final. Actualisez Langfuse après l’exécution si correctness est toujours en attente.

Sur cette page

FR