06 Experimentos
Guia do participante: 06 Experimentos
O material do workshop é mantido no repositório público langfuse/langfuse-workshop. Use o repositório para executar a aplicação, acessar os branches de checkpoint e fazer a configuração local.
Guia do participante: 06 Experimentos
Notas para o instrutor
- A ideia principal é reutilizar: o executor do experimento chama o mesmo
runSupportConversation(...)da aplicação web. - Compare a pontuação determinística no script (
keyword_overlap) com a pontuação LLM-as-a-judge (correctness). - Confirme o modelo padrão de avaliação antes de configurar Correctness. Se os participantes não o configuraram na sessão 4, envie-os primeiro a Project Settings → LLM Connections.
- Destaque a configuração mista: o script controla a verificação determinística barata, enquanto o Langfuse controla o juiz semântico.
- Mantenha a concorrência em um durante workshops, para que os traces e o resumo final sejam fáceis de acompanhar.
Ritmo da demonstração
- Percorra rapidamente as seções numeradas de
scripts/run-dataset.ts. - Mostre o avaliador
keyword_overlapdentro do script. - Configure o avaliador Correctness como avaliador de execução de dataset.
- Execute
npm run dataset:run. - Abra a tabela de execuções, os traces por item e a visualização de gráfico.
Fique atento
- Alvo do avaliador Correctness. Mantenha Run on em Experiments para que a pontuação apareça nas linhas e na comparação de execuções.
- Peça aos participantes que mudem Run on do padrão Observations para Experiments antes de configurar qualquer outra coisa.
- Se ainda não houver uma execução, a tabela de revisão ou a prévia do prompt poderá estar vazia. Isso é esperado antes de
npm run dataset:runcriar a primeira execução. - O mapeamento do avaliador Correctness usa três fontes distintas:
queryé Input com$.messages[-1].content,generationé Output sem JsonPath eground_truthé Expected Output com$.idealAnswer. - Um erro comum é deixar as três variáveis em Input, fazendo o avaliador ler silenciosamente os dados errados em todos os campos.
- Participantes supondo que a verificação determinística agora precisa viver no Langfuse. Não precisa; mencione a documentação de code evaluators apenas como alternativa.
- “No default model set” significa que o Langfuse precisa de uma conexão LLM e de um modelo padrão de avaliação; editar
.envnão resolve. - Resultados assíncronos lentos; o console mostra apenas o resumo final, então atualize o Langfuse depois da execução se
correctnessainda estiver pendente.