04 Monitorización
Guía del participante: 04 Monitorización
El material del workshop se mantiene en el repositorio público langfuse/langfuse-workshop. Usa el repositorio para ejecutar la aplicación, acceder a las ramas de checkpoint y realizar la configuración local.
Guía del participante: 04 Monitorización
Notas para el instructor
- Sigue siendo un capítulo centrado en la interfaz, pero combina dos tipos de evaluador: LLM-as-a-judge para señales semánticas y un code evaluator para una señal determinista de frustración.
- Termina cargando datos: cuando los monitores estén activos,
npm run langfuse:seed:otel:no-scoresenvía al proyecto un lote realista de tráficoproduction, incluidos casos fuera de alcance, en mayúsculas y de desacuerdo. Como los evaluadores ya se ejecutan, todo se puntúa en directo. La variante:no-scoreses intencionada: las puntuaciones deben proceder de los evaluadores del participante, no de la carga. Recuerda que no es idempotente; repetirlo duplica los datos. - Antes del primer evaluador, confirma Project Settings → LLM Connections. En proyectos nuevos, el asistente Set up evaluator se detiene en Set up LLM connection hasta guardar un modelo predeterminado; haz que elijan la conexión OpenAI y un modelo compatible con salida estructurada.
- Las plantillas gestionadas están en Use existing. Quien elige Create from scratch → LLM as a judge evaluator llega a un formulario vacío Create new evaluator y cree que las plantillas han desaparecido; debe cerrar el diálogo y elegir en la lista.
- Explica por qué los monitores apuntan a observaciones distintas: out-of-scope necesita el prompt de sistema en la generation y disagreement necesita el historial en la raíz del agente.
- Explica por qué el monitor de mayúsculas usa código: una regla determinista sencilla no necesita una llamada al modelo.
- Usa los primeros resultados como ejercicio de depuración, no solo como aprobado o suspenso.
Ritmo de la demostración
- Configura Out-of-Scope Request en las observaciones de la generation final.
- Configura User Disagreement en la observación del agente
dad-it-support-chat-turn. - Configura el code evaluator de mayúsculas en la misma observación
dad-it-support-chat-turn. - Envía un turno normal dentro del alcance, uno fuera, uno de desacuerdo y uno en mayúsculas.
- Carga tráfico de producción con
npm run langfuse:seed:otel:no-scores, actualiza Tracing y observa cómo los evaluadores puntúan el lote.
Presta atención
- Elegir por accidente la plantilla incorrecta para User Disagreement.
- Considerar suficientes las claves de Langfuse de
.env. Los evaluadores con juez también necesitan la conexión LLM de Langfuse. - Mapear
last_user_messageal último elemento de la conversación en una generation final; las generations finales incluyen mensajes de herramientas después del turno del usuario. - Para la señal de mayúsculas, utiliza la versión Python de la documentación del participante en lugar de pelear con el editor TypeScript.
- Participantes que consideren la puntuación de mayúsculas una garantía de enfado. Preséntala como señal de triaje, no como veredicto.