06 Experimentos
Guía del participante: 06 Experimentos
El material del workshop se mantiene en el repositorio público langfuse/langfuse-workshop. Usa el repositorio para ejecutar la aplicación, acceder a las ramas de checkpoint y realizar la configuración local.
Guía del participante: 06 Experimentos
Notas para el instructor
- La idea clave es reutilizar: el ejecutor del experimento llama al mismo
runSupportConversation(...)que la aplicación web. - Contrasta la puntuación determinista del script (
keyword_overlap) con la puntuación LLM-as-a-judge (correctness). - Confirma el modelo predeterminado de evaluación antes de configurar Correctness. Si los participantes no lo hicieron en la sesión 4, envíalos primero a Project Settings → LLM Connections.
- Destaca la configuración mixta: el script controla la comprobación determinista barata y Langfuse controla el juez semántico.
- Mantén la concurrencia en uno durante el workshop para que los traces y el resumen final sean fáciles de seguir.
Ritmo de la demostración
- Recorre brevemente las secciones numeradas de
scripts/run-dataset.ts. - Señala el evaluador
keyword_overlapdentro del script. - Configura Correctness como evaluador de ejecuciones de dataset.
- Ejecuta
npm run dataset:run. - Abre la tabla de ejecuciones, los traces por elemento y la vista de gráfico.
Presta atención
- Objetivo del evaluador Correctness. Mantén Run on en Experiments para que la puntuación aparezca en las filas y en la comparación de ejecuciones.
- Haz que los participantes cambien Run on del valor predeterminado Observations a Experiments antes de configurar nada más.
- Si aún no existe una ejecución, la tabla de revisión o la vista previa del prompt pueden estar vacías. Es lo esperado antes de que
npm run dataset:runcree la primera. - El mapeo de Correctness utiliza tres fuentes distintas:
queryes Input con$.messages[-1].content,generationes Output sin JsonPath yground_truthes Expected Output con$.idealAnswer. - Un error común es dejar las tres variables en Input, haciendo que el evaluador lea silenciosamente datos incorrectos en todos los campos.
- Participantes que supongan que la comprobación determinista debe vivir ahora en Langfuse. No es así; menciona la documentación de code evaluators solo como alternativa.
- “No default model set” significa que Langfuse necesita una conexión LLM y un modelo predeterminado de evaluación; no se arregla editando
.env. - Resultados asíncronos lentos; la consola solo muestra el resumen final, así que actualiza Langfuse tras la ejecución si
correctnesssigue pendiente.