Langfuse WorkshopClickHouse Workshops

04 Monitorización

Guía del participante: 04 Monitorización

El material del workshop se mantiene en el repositorio público langfuse/langfuse-workshop. Usa el repositorio para ejecutar la aplicación, acceder a las ramas de checkpoint y realizar la configuración local.

Ver este archivo Markdown

Guía del participante: 04 Monitorización

Notas para el instructor

  • Sigue siendo un capítulo centrado en la interfaz, pero combina dos tipos de evaluador: LLM-as-a-judge para señales semánticas y un code evaluator para una señal determinista de frustración.
  • Termina cargando datos: cuando los monitores estén activos, npm run langfuse:seed:otel:no-scores envía al proyecto un lote realista de tráfico production, incluidos casos fuera de alcance, en mayúsculas y de desacuerdo. Como los evaluadores ya se ejecutan, todo se puntúa en directo. La variante :no-scores es intencionada: las puntuaciones deben proceder de los evaluadores del participante, no de la carga. Recuerda que no es idempotente; repetirlo duplica los datos.
  • Antes del primer evaluador, confirma Project Settings → LLM Connections. En proyectos nuevos, el asistente Set up evaluator se detiene en Set up LLM connection hasta guardar un modelo predeterminado; haz que elijan la conexión OpenAI y un modelo compatible con salida estructurada.
  • Las plantillas gestionadas están en Use existing. Quien elige Create from scratch → LLM as a judge evaluator llega a un formulario vacío Create new evaluator y cree que las plantillas han desaparecido; debe cerrar el diálogo y elegir en la lista.
  • Explica por qué los monitores apuntan a observaciones distintas: out-of-scope necesita el prompt de sistema en la generation y disagreement necesita el historial en la raíz del agente.
  • Explica por qué el monitor de mayúsculas usa código: una regla determinista sencilla no necesita una llamada al modelo.
  • Usa los primeros resultados como ejercicio de depuración, no solo como aprobado o suspenso.

Ritmo de la demostración

  1. Configura Out-of-Scope Request en las observaciones de la generation final.
  2. Configura User Disagreement en la observación del agente dad-it-support-chat-turn.
  3. Configura el code evaluator de mayúsculas en la misma observación dad-it-support-chat-turn.
  4. Envía un turno normal dentro del alcance, uno fuera, uno de desacuerdo y uno en mayúsculas.
  5. Carga tráfico de producción con npm run langfuse:seed:otel:no-scores, actualiza Tracing y observa cómo los evaluadores puntúan el lote.

Presta atención

  • Elegir por accidente la plantilla incorrecta para User Disagreement.
  • Considerar suficientes las claves de Langfuse de .env. Los evaluadores con juez también necesitan la conexión LLM de Langfuse.
  • Mapear last_user_message al último elemento de la conversación en una generation final; las generations finales incluyen mensajes de herramientas después del turno del usuario.
  • Para la señal de mayúsculas, utiliza la versión Python de la documentación del participante en lugar de pelear con el editor TypeScript.
  • Participantes que consideren la puntuación de mayúsculas una garantía de enfado. Preséntala como señal de triaje, no como veredicto.

En esta página

ES