Agent Arena — Workshop de Langfuse
Coloque vários LLMs em uma competição de NL→SQL no ClickHouse, escolha o vencedor e continue aprimorando-o — tudo instrumentado com Langfuse desde o primeiro passo.
Bem-vindo ao playbook do Agent Arena. O Agent Arena é uma competição direta entre agentes LLM: ao longo deste workshop, você coloca vários LLMs para disputar uma tarefa específica — linguagem natural para SQL sobre um conjunto de dados de e-commerce no ClickHouse — e escolhe o vencedor com evidências, não com um ranking público. O Langfuse está conectado desde o primeiro módulo: ele executa a competição, mede a qualidade do vencedor, orienta a melhoria contínua e segue até a produção.
Por que este workshop
Ao criar uma aplicação séria com agentes, uma das primeiras decisões — e uma das mais importantes — é qual modelo usar. Os modelos variam muito em capacidade e preço, e a escolha certa depende da sua tarefa, não do ranking público de outra pessoa. Um palpite errado leva a um de dois extremos: pagar demais por um modelo de fronteira desnecessário ou lançar um modelo barato que erra silenciosamente sua carga real.
A resposta disciplinada é realizar sua própria competição: executar uma grade de modelos e estratégias de prompt como experimentos do Langfuse sobre seu próprio conjunto de dados dourado e deixar o custo por resposta correta — qualidade por dólar para o seu caso de uso — definir o vencedor. Essa decisão sustenta todo o restante; não adianta medir, aprimorar ou lançar um agente construído sobre o modelo errado.
O caso de uso é um chatbot de NL→SQL, com um único fluxo: selecionar o modelo base → medir offline → lançar e detectar → investigar com uma pessoa → comprovar e monitorar a melhoria. O Langfuse conecta cada etapa — o mesmo projeto, traces, feedback, anotações, evaluators e datasets desde o Módulo 00 até o ciclo de melhoria em produção.
O playbook tem duas trilhas. A trilha do participante contém a lição seguida durante a sessão. A trilha do instrutor é o guia do facilitador para o mesmo módulo: tempo, roteiro, falhas comuns e recuperação.
Módulos
| # | Participante | Instrutor | Resultado |
|---|---|---|---|
| 00 | Configuração | notas | OpenRouter, ClickHouse e Langfuse conectados — Langfuse instrumentado antes da escolha de qualquer modelo — e dataset do Agent Arena preparado |
| 01 | Selecionar o modelo base | notas | Competição executada como experimentos do Langfuse; vencedor escolhido pelo custo por resposta correta — a decisão fundamental |
| 02 | Medir offline | notas | Qualidade do vencedor compreendida por pergunta e nível antes do lançamento, usando evaluators, datasets e traces do Langfuse |
| 03 | Lançar e detectar | notas | Agente lançado com uma lacuna conhecida de política; o SQL executável passa na avaliação operacional enquanto o feedback real sinaliza a resposta |
| 04 | Investigar | notas | Uma pessoa segue o feedback negativo até o trace autoritativo, diagnostica a política desatualizada, verifica a correção e registra a proveniência de produção |
| 05 | Fechar o ciclo | notas | O incidente revisado vira dado dourado; experimentos pareados comprovam a melhoria, um evaluator geral de políticas é calibrado e ativado online, e o tráfego futuro é monitorado |