04 Monitoramento
Guia do participante: 04 Monitoramento
O material do workshop é mantido no repositório público langfuse/langfuse-workshop. Use o repositório para executar a aplicação, acessar os branches de checkpoint e fazer a configuração local.
Guia do participante: 04 Monitoramento
Notas para o instrutor
- Este ainda é um capítulo orientado pela interface, mas combina dois tipos de avaliador: LLM-as-a-judge para sinais semânticos e um code evaluator para um sinal determinístico de frustração.
- Encerre carregando dados: depois que os monitores estiverem ativos,
npm run langfuse:seed:otel:no-scoresenvia ao projeto um lote realista de tráfegoproduction— inclusive casos fora do escopo, em maiúsculas e de discordância. Como os avaliadores já estão rodando, tudo é pontuado ao vivo. A variante:no-scoresé intencional: as pontuações devem vir dos avaliadores do participante, não da carga. Lembre que o comando não é idempotente; executá-lo novamente duplica os dados. - Antes do primeiro avaliador, confirme Project Settings → LLM Connections. Em projetos novos, o assistente Set up evaluator para na etapa Set up LLM connection até que um modelo padrão seja salvo; peça que escolham a conexão OpenAI e um modelo compatível com saída estruturada.
- Os templates gerenciados ficam em Use existing na página de configuração. Quem escolhe Create from scratch → LLM as a judge evaluator chega a um formulário vazio de Create new evaluator e pensa que os templates sumiram; feche o diálogo e escolha na lista.
- Explique por que os monitores apontam para observações diferentes: out-of-scope precisa do prompt de sistema na generation; disagreement precisa do histórico na raiz do agente.
- Explique por que o monitor de maiúsculas usa código: uma regra determinística simples dispensa uma chamada ao modelo.
- Use os primeiros resultados como exercício de depuração, não só como aprovação ou reprovação.
Ritmo da demonstração
- Configure Out-of-Scope Request nas observações da generation final.
- Configure User Disagreement na observação do agente
dad-it-support-chat-turn. - Configure o code evaluator de maiúsculas na mesma observação
dad-it-support-chat-turn. - Envie um turno normal dentro do escopo, um fora do escopo, um de discordância e um em maiúsculas.
- Carregue tráfego de produção com
npm run langfuse:seed:otel:no-scores, atualize Tracing e veja os avaliadores pontuarem o lote.
Fique atento
- Escolha acidental do template errado para User Disagreement.
- Tratar as chaves do Langfuse em
.envcomo suficientes para avaliadores. Avaliadores com juiz também precisam da conexão LLM no Langfuse. - Mapear
last_user_messagepara o último item da conversa em uma generation final; generations finais incluem mensagens de ferramentas depois do turno do usuário. - Para o sinal de maiúsculas, prefira a versão em Python da documentação do participante em vez de lutar com o editor TypeScript.
- Participantes tratando a pontuação de maiúsculas como garantia de raiva. Apresente-a como sinal de triagem, não como veredito.