Trilha do participante
As lições práticas realizadas durante a sessão.
Esta é a trilha do participante: as lições práticas realizadas durante o workshop. Cada módulo se apoia no anterior e conduz o chatbot de NL→SQL do Agent Arena por um único fluxo: selecionar o modelo base → medir offline → lançar e detectar → investigar com uma pessoa → comprovar e monitorar a melhoria — tudo instrumentado com Langfuse desde o primeiro módulo, servido pelo OpenRouter e apoiado pelo ClickHouse.
O percurso começa pela decisão mais importante na criação de um agente sério: qual modelo usar. O Módulo 01 responde com evidências — a competição executada como experimentos do Langfuse e classificada pelo custo por resposta correta — e todos os módulos seguintes partem dessa escolha.
Siga os módulos em ordem:
- 00 Configuração — conecte OpenRouter, ClickHouse Cloud e Langfuse Cloud e prepare o banco de dados.
- 01 Selecionar o modelo base — a decisão fundamental: execute a grade de modelo × prompt como experimentos do Langfuse e escolha o vencedor pelo custo por resposta correta.
- 02 Medir offline — vá além de “venceu”: leia a precisão por nível, a pontuação
agent-arena-llm-judgee traces individuais para entender o desempenho real. - 03 Lançar e detectar — lance a configuração selecionada com uma política de negócio desatualizada e veja um evaluator operacional aprovar enquanto o 👎 de um usuário real revela a lacuna.
- 04 Investigar — use o feedback para encontrar o trace de produção autoritativo, concluir uma anotação humana, verificar a correção e registrar sua proveniência.
- 05 Fechar o ciclo — promova o incidente revisado, comprove a melhoria da política com experimentos pareados, calibre e ative um evaluator online geral e monitore pontuações e feedback futuros.
Consulte a visão geral para ver a tabela completa de módulos e as notas correspondentes da trilha do instrutor.