Trilha do instrutor
Tempo, roteiro, falhas comuns e etapas de recuperação para facilitadores.
Esta é a trilha do instrutor: o guia do facilitador que acompanha a trilha do participante. Cada módulo corresponde à lição do participante e acrescenta orientação de tempo, roteiro, falhas comuns e etapas de recuperação para conduzir a sessão ao vivo.
O workshop segue um único arco: selecionar o modelo base → medir offline → lançar e detectar → investigar com uma pessoa → comprovar e monitorar a melhoria.
Tempo total
| Módulo | Lição do participante | Notas do instrutor | Resultado | Tempo |
|---|---|---|---|---|
| 00 | Configuração | notas | Conectar OpenRouter, ClickHouse e Langfuse; preparar os dados do Agent Arena. | 20 min |
| 01 | Selecionar o modelo base | notas | Executar a competição e escolher uma configuração pelo custo por resposta correta. | 20 min |
| 02 | Medir offline | notas | Ler as pontuações e traces offline do vencedor antes do lançamento. | 15 min |
| 03 | Lançar e detectar | notas | Lançar a política desatualizada e registrar a divergência entre aprovação do evaluator e reprovação do usuário. | 15 min |
| 04 | Investigar | notas | Concluir um diagnóstico humano baseado primeiro em evidências e entregar a saída corrigida. | 20 min |
| 05 | Fechar o ciclo | notas | Ampliar o dataset dourado, comprovar a correção e ativar uma proteção online calibrada. | 25 min |
São 115 minutos — cerca de 1 hora e 55 minutos — de trabalho prático na sessão completa, além das transições.
Preparação da sala
- Um
.envpor participante (ou dupla), preenchido com suas próprias contas do OpenRouter, Langfuse Cloud e ClickHouse Cloud. As credenciais não são compartilhadas, pois o Módulo 00 também provisiona um usuário somente leituraarena_rodedicado por preparação. - Projete seu próprio projeto no Langfuse Cloud, separado dos projetos dos participantes, para demonstrar experimentos, traces de produção, anotações e evaluators nos Módulos 01 a 05.
- Mantenha um terminal pronto para executar
scripts/arena.sh status: ele informa se a API do dashboard e a interface web estão ativas e mostra a contagem de linhas de cada viewv_*.scripts/arena.sh upprepara o dataset de negócio no ClickHouse e inicia os serviços locais; os resultados do benchmark ficam no Langfuse (sem Aurora, ClickPipes ou ClickStack neste workshop).
Checklist de pré-requisitos
Confirme tudo antes do Módulo 00, de preferência no dia anterior:
- Os participantes criaram (ou receberam) contas no OpenRouter, Langfuse Cloud e ClickHouse Cloud, com chaves de API reais — não placeholders.
- Os participantes clonaram o repositório e conseguem criar um ambiente virtual Python (
python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt). - O Node.js está instalado para a aba web Chat (
cd web && npm install), necessária no Módulo 00 (dashboard) e novamente no Módulo 03 (aba Chat). - Você leu
eval/langfuse_evaluators/README.md— a configuração única dos evaluators do Langfuse no Módulo 01 é a etapa mais delicada da sessão e merece um ensaio. - Você consegue executar
source .env && scripts/arena.sh upde ponta a ponta antes da sessão e sabe reconhecer uma preparação correta quando a execução de um participante divergir.