Langfuse WorkshopClickHouse Workshops

06 Experimentos

Guia do participante: 06 Experimentos

O material do workshop é mantido no repositório público langfuse/langfuse-workshop. Use o repositório para executar a aplicação, acessar os branches de checkpoint e fazer a configuração local.

Ver este arquivo Markdown

Guia do participante: 06 Experimentos

Notas para o instrutor

  • A ideia principal é reutilizar: o executor do experimento chama o mesmo runSupportConversation(...) da aplicação web.
  • Compare a pontuação determinística no script (keyword_overlap) com a pontuação LLM-as-a-judge (correctness).
  • Confirme o modelo padrão de avaliação antes de configurar Correctness. Se os participantes não o configuraram na sessão 4, envie-os primeiro a Project Settings → LLM Connections.
  • Destaque a configuração mista: o script controla a verificação determinística barata, enquanto o Langfuse controla o juiz semântico.
  • Mantenha a concorrência em um durante workshops, para que os traces e o resumo final sejam fáceis de acompanhar.

Ritmo da demonstração

  1. Percorra rapidamente as seções numeradas de scripts/run-dataset.ts.
  2. Mostre o avaliador keyword_overlap dentro do script.
  3. Configure o avaliador Correctness como avaliador de execução de dataset.
  4. Execute npm run dataset:run.
  5. Abra a tabela de execuções, os traces por item e a visualização de gráfico.

Fique atento

  • Alvo do avaliador Correctness. Mantenha Run on em Experiments para que a pontuação apareça nas linhas e na comparação de execuções.
  • Peça aos participantes que mudem Run on do padrão Observations para Experiments antes de configurar qualquer outra coisa.
  • Se ainda não houver uma execução, a tabela de revisão ou a prévia do prompt poderá estar vazia. Isso é esperado antes de npm run dataset:run criar a primeira execução.
  • O mapeamento do avaliador Correctness usa três fontes distintas: query é Input com $.messages[-1].content, generation é Output sem JsonPath e ground_truth é Expected Output com $.idealAnswer.
  • Um erro comum é deixar as três variáveis em Input, fazendo o avaliador ler silenciosamente os dados errados em todos os campos.
  • Participantes supondo que a verificação determinística agora precisa viver no Langfuse. Não precisa; mencione a documentação de code evaluators apenas como alternativa.
  • “No default model set” significa que o Langfuse precisa de uma conexão LLM e de um modelo padrão de avaliação; editar .env não resolve.
  • Resultados assíncronos lentos; o console mostra apenas o resumo final, então atualize o Langfuse depois da execução se correctness ainda estiver pendente.

Nesta página

PT