Langfuse WorkshopClickHouse Workshops

04 Monitoramento

Guia do participante: 04 Monitoramento

O material do workshop é mantido no repositório público langfuse/langfuse-workshop. Use o repositório para executar a aplicação, acessar os branches de checkpoint e fazer a configuração local.

Ver este arquivo Markdown

Guia do participante: 04 Monitoramento

Notas para o instrutor

  • Este ainda é um capítulo orientado pela interface, mas combina dois tipos de avaliador: LLM-as-a-judge para sinais semânticos e um code evaluator para um sinal determinístico de frustração.
  • Encerre carregando dados: depois que os monitores estiverem ativos, npm run langfuse:seed:otel:no-scores envia ao projeto um lote realista de tráfego production — inclusive casos fora do escopo, em maiúsculas e de discordância. Como os avaliadores já estão rodando, tudo é pontuado ao vivo. A variante :no-scores é intencional: as pontuações devem vir dos avaliadores do participante, não da carga. Lembre que o comando não é idempotente; executá-lo novamente duplica os dados.
  • Antes do primeiro avaliador, confirme Project Settings → LLM Connections. Em projetos novos, o assistente Set up evaluator para na etapa Set up LLM connection até que um modelo padrão seja salvo; peça que escolham a conexão OpenAI e um modelo compatível com saída estruturada.
  • Os templates gerenciados ficam em Use existing na página de configuração. Quem escolhe Create from scratch → LLM as a judge evaluator chega a um formulário vazio de Create new evaluator e pensa que os templates sumiram; feche o diálogo e escolha na lista.
  • Explique por que os monitores apontam para observações diferentes: out-of-scope precisa do prompt de sistema na generation; disagreement precisa do histórico na raiz do agente.
  • Explique por que o monitor de maiúsculas usa código: uma regra determinística simples dispensa uma chamada ao modelo.
  • Use os primeiros resultados como exercício de depuração, não só como aprovação ou reprovação.

Ritmo da demonstração

  1. Configure Out-of-Scope Request nas observações da generation final.
  2. Configure User Disagreement na observação do agente dad-it-support-chat-turn.
  3. Configure o code evaluator de maiúsculas na mesma observação dad-it-support-chat-turn.
  4. Envie um turno normal dentro do escopo, um fora do escopo, um de discordância e um em maiúsculas.
  5. Carregue tráfego de produção com npm run langfuse:seed:otel:no-scores, atualize Tracing e veja os avaliadores pontuarem o lote.

Fique atento

  • Escolha acidental do template errado para User Disagreement.
  • Tratar as chaves do Langfuse em .env como suficientes para avaliadores. Avaliadores com juiz também precisam da conexão LLM no Langfuse.
  • Mapear last_user_message para o último item da conversa em uma generation final; generations finais incluem mensagens de ferramentas depois do turno do usuário.
  • Para o sinal de maiúsculas, prefira a versão em Python da documentação do participante em vez de lutar com o editor TypeScript.
  • Participantes tratando a pontuação de maiúsculas como garantia de raiva. Apresente-a como sinal de triagem, não como veredito.

Nesta página

PT