Langfuse WorkshopClickHouse Workshops

06 Experimentos

Guía del participante: 06 Experimentos

El material del workshop se mantiene en el repositorio público langfuse/langfuse-workshop. Usa el repositorio para ejecutar la aplicación, acceder a las ramas de checkpoint y realizar la configuración local.

Ver este archivo Markdown

Guía del participante: 06 Experimentos

Notas para el instructor

  • La idea clave es reutilizar: el ejecutor del experimento llama al mismo runSupportConversation(...) que la aplicación web.
  • Contrasta la puntuación determinista del script (keyword_overlap) con la puntuación LLM-as-a-judge (correctness).
  • Confirma el modelo predeterminado de evaluación antes de configurar Correctness. Si los participantes no lo hicieron en la sesión 4, envíalos primero a Project Settings → LLM Connections.
  • Destaca la configuración mixta: el script controla la comprobación determinista barata y Langfuse controla el juez semántico.
  • Mantén la concurrencia en uno durante el workshop para que los traces y el resumen final sean fáciles de seguir.

Ritmo de la demostración

  1. Recorre brevemente las secciones numeradas de scripts/run-dataset.ts.
  2. Señala el evaluador keyword_overlap dentro del script.
  3. Configura Correctness como evaluador de ejecuciones de dataset.
  4. Ejecuta npm run dataset:run.
  5. Abre la tabla de ejecuciones, los traces por elemento y la vista de gráfico.

Presta atención

  • Objetivo del evaluador Correctness. Mantén Run on en Experiments para que la puntuación aparezca en las filas y en la comparación de ejecuciones.
  • Haz que los participantes cambien Run on del valor predeterminado Observations a Experiments antes de configurar nada más.
  • Si aún no existe una ejecución, la tabla de revisión o la vista previa del prompt pueden estar vacías. Es lo esperado antes de que npm run dataset:run cree la primera.
  • El mapeo de Correctness utiliza tres fuentes distintas: query es Input con $.messages[-1].content, generation es Output sin JsonPath y ground_truth es Expected Output con $.idealAnswer.
  • Un error común es dejar las tres variables en Input, haciendo que el evaluador lea silenciosamente datos incorrectos en todos los campos.
  • Participantes que supongan que la comprobación determinista debe vivir ahora en Langfuse. No es así; menciona la documentación de code evaluators solo como alternativa.
  • “No default model set” significa que Langfuse necesita una conexión LLM y un modelo predeterminado de evaluación; no se arregla editando .env.
  • Resultados asíncronos lentos; la consola solo muestra el resumen final, así que actualiza Langfuse tras la ejecución si correctness sigue pendiente.

En esta página

ES