Uma competição realizada e decidida
Dezoito configurações de modelo × prompt avaliadas com suas perguntas douradas e classificadas pelo custo por resposta correta.
ClickHouse Série de casos de uso
Em 90 minutos, você realiza sua própria competição — seis modelos com três estratégias de prompt, respondendo em SQL a perguntas reais de negócio sobre o ClickHouse — e decide o que implantar com base em evidências: custo por resposta correta, não um ranking público.
Não é um ranking público. É a sua competição.
Escolher um modelo é a primeira decisão importante de uma aplicação com agentes — e aquela em que mais se aposta no escuro. Escolha acima do necessário e você pagará preços de modelos de fronteira por uma capacidade que a tarefa não exige. Escolha abaixo e colocará em produção algo que erra silenciosamente sua carga real.
Por isso, você mesmo realiza a competição. Uma grade de seis modelos e três estratégias de prompt responde a um conjunto de perguntas de negócio com respostas conhecidas sobre um dataset ativo no ClickHouse.
Cada resposta é avaliada pela precisão de execução — se a consulta retornou o resultado correto, não apenas um SQL com boa aparência — e cada configuração é classificada pelo custo por resposta correta. É qualidade por dólar na sua tarefa, o único número capaz de encerrar a discussão.
Langfuse entra no módulo 00, não como um complemento no final: executa a competição como experimentos, avalia com um verificador em código e um juiz LLM, armazena cada trace e acompanha o vencedor até produção.
O que você levará
Na sua própria avaliação do ClickHouse Cloud, no seu projeto Langfuse e com uma chave do OpenRouter.
Dezoito configurações de modelo × prompt avaliadas com suas perguntas douradas e classificadas pelo custo por resposta correta.
Um avaliador de correção e um juiz LLM executados no servidor do seu projeto Langfuse, pontuando cada execução.
Respostas comparadas a conjuntos de resultados dourados em cache — posição das colunas, arredondamento de floats e normalização do conjunto de linhas — para impedir que uma consulta aparentemente correta passe por sorte.
Respostas revisadas viram novas perguntas douradas e a grade é executada novamente — o ciclo inteiro visível de ponta a ponta no Langfuse.
A configuração vencedora ativa por trás de POST /ask, com tracing por sessão e avaliações positivas/negativas gravadas como scores no Langfuse.
Harness, agente, proteção de SQL somente leitura, API de serviço e interface da arena — tudo seu para apontar aos seus próprios dados.
O percurso · cerca de 90 min práticos
Um único fluxo, do início ao fim: escolha um modelo com evidências, entenda-o, melhore-o e observe-o em produção.
Conecte OpenRouter, ClickHouse Cloud e Langfuse — com tracing antes de escolher qualquer modelo — e carregue o dataset da arena.
Execute a grade de modelos × prompts como experimentos do Langfuse e escolha o vencedor pelo custo por resposta correta.
Vá além de “ele venceu”: precisão por nível, sinal llm_judge e traces individuais do prompt ao SQL gerado.
Transforme respostas revisadas em novas perguntas douradas pela fila de anotação e execute novamente a grade.
Sirva a configuração vencedora por uma API real e acompanhe traces, sessões, custos e feedback positivo/negativo em produção.
Autoguiado por padrão. Cada módulo informa o checkpoint inicial e termina com uma verificação que você mesmo pode conferir; ninguém fica preso ao ritmo da sala.
Antes de participar
Traga uma avaliação do ClickHouse Cloud, um projeto Langfuse e uma chave do OpenRouter. Saia sabendo qual modelo implantar, quanto custa cada resposta correta e como provar tudo novamente no próximo trimestre.