Agent ArenaClickHouse Workshops
Agent Arena

Agent Arena — Workshop de Langfuse

Coloque vários LLMs em uma competição de NL→SQL no ClickHouse, escolha o vencedor e continue aprimorando-o — tudo instrumentado com Langfuse desde o primeiro passo.

Bem-vindo ao playbook do Agent Arena. O Agent Arena é uma competição direta entre agentes LLM: ao longo deste workshop, você coloca vários LLMs para disputar uma tarefa específica — linguagem natural para SQL sobre um conjunto de dados de e-commerce no ClickHouse — e escolhe o vencedor com evidências, não com um ranking público. O Langfuse está conectado desde o primeiro módulo: ele executa a competição, mede a qualidade do vencedor, orienta a melhoria contínua e segue até a produção.

Por que este workshop

Ao criar uma aplicação séria com agentes, uma das primeiras decisões — e uma das mais importantes — é qual modelo usar. Os modelos variam muito em capacidade e preço, e a escolha certa depende da sua tarefa, não do ranking público de outra pessoa. Um palpite errado leva a um de dois extremos: pagar demais por um modelo de fronteira desnecessário ou lançar um modelo barato que erra silenciosamente sua carga real.

A resposta disciplinada é realizar sua própria competição: executar uma grade de modelos e estratégias de prompt como experimentos do Langfuse sobre seu próprio conjunto de dados dourado e deixar o custo por resposta correta — qualidade por dólar para o seu caso de uso — definir o vencedor. Essa decisão sustenta todo o restante; não adianta medir, aprimorar ou lançar um agente construído sobre o modelo errado.

O caso de uso é um chatbot de NL→SQL, com um único fluxo: selecionar o modelo base → medir offline → lançar e detectar → investigar com uma pessoa → comprovar e monitorar a melhoria. O Langfuse conecta cada etapa — o mesmo projeto, traces, feedback, anotações, evaluators e datasets desde o Módulo 00 até o ciclo de melhoria em produção.

O playbook tem duas trilhas. A trilha do participante contém a lição seguida durante a sessão. A trilha do instrutor é o guia do facilitador para o mesmo módulo: tempo, roteiro, falhas comuns e recuperação.

Módulos

#ParticipanteInstrutorResultado
00ConfiguraçãonotasOpenRouter, ClickHouse e Langfuse conectados — Langfuse instrumentado antes da escolha de qualquer modelo — e dataset do Agent Arena preparado
01Selecionar o modelo basenotasCompetição executada como experimentos do Langfuse; vencedor escolhido pelo custo por resposta correta — a decisão fundamental
02Medir offlinenotasQualidade do vencedor compreendida por pergunta e nível antes do lançamento, usando evaluators, datasets e traces do Langfuse
03Lançar e detectarnotasAgente lançado com uma lacuna conhecida de política; o SQL executável passa na avaliação operacional enquanto o feedback real sinaliza a resposta
04InvestigarnotasUma pessoa segue o feedback negativo até o trace autoritativo, diagnostica a política desatualizada, verifica a correção e registra a proveniência de produção
05Fechar o ciclonotasO incidente revisado vira dado dourado; experimentos pareados comprovam a melhoria, um evaluator geral de políticas é calibrado e ativado online, e o tráfego futuro é monitorado

Nesta página

PT