ClickHouse Série de casos de uso

Escolha o vencedor.
Comprove o custo.

Em 90 minutos, você realiza sua própria competição — seis modelos com três estratégias de prompt, respondendo em SQL a perguntas reais de negócio sobre o ClickHouse — e decide o que implantar com base em evidências: custo por resposta correta, não um ranking público.

90 minutos · do início ao fim18 configurações avaliadasLangfuse desde a etapa 0US$ 0 com créditos de avaliação

Não é um ranking público. É a sua competição.

Escolher um modelo é a primeira decisão importante de uma aplicação com agentes — e aquela em que mais se aposta no escuro. Escolha acima do necessário e você pagará preços de modelos de fronteira por uma capacidade que a tarefa não exige. Escolha abaixo e colocará em produção algo que erra silenciosamente sua carga real.

Por isso, você mesmo realiza a competição. Uma grade de seis modelos e três estratégias de prompt responde a um conjunto de perguntas de negócio com respostas conhecidas sobre um dataset ativo no ClickHouse.

Cada resposta é avaliada pela precisão de execução — se a consulta retornou o resultado correto, não apenas um SQL com boa aparência — e cada configuração é classificada pelo custo por resposta correta. É qualidade por dólar na sua tarefa, o único número capaz de encerrar a discussão.

Langfuse entra no módulo 00, não como um complemento no final: executa a competição como experimentos, avalia com um verificador em código e um juiz LLM, armazena cada trace e acompanha o vencedor até produção.

O que você levará

Tudo o que estará em execução ao final.

Na sua própria avaliação do ClickHouse Cloud, no seu projeto Langfuse e com uma chave do OpenRouter.

01

Uma competição realizada e decidida

Dezoito configurações de modelo × prompt avaliadas com suas perguntas douradas e classificadas pelo custo por resposta correta.

02

Experimentos e avaliadores no Langfuse

Um avaliador de correção e um juiz LLM executados no servidor do seu projeto Langfuse, pontuando cada execução.

03

Uma avaliação que você pode defender

Respostas comparadas a conjuntos de resultados dourados em cache — posição das colunas, arredondamento de floats e normalização do conjunto de linhas — para impedir que uma consulta aparentemente correta passe por sorte.

04

Um ciclo de melhoria contínua

Respostas revisadas viram novas perguntas douradas e a grade é executada novamente — o ciclo inteiro visível de ponta a ponta no Langfuse.

05

O vencedor em produção

A configuração vencedora ativa por trás de POST /ask, com tracing por sessão e avaliações positivas/negativas gravadas como scores no Langfuse.

+

O repositório completo

Harness, agente, proteção de SQL somente leitura, API de serviço e interface da arena — tudo seu para apontar aos seus próprios dados.

O percurso · cerca de 90 min práticos

Cinco paradas, na ordem.

Um único fluxo, do início ao fim: escolha um modelo com evidências, entenda-o, melhore-o e observe-o em produção.

  1. 00

    Configuração

    20 min

    Conecte OpenRouter, ClickHouse Cloud e Langfuse — com tracing antes de escolher qualquer modelo — e carregue o dataset da arena.

  2. 01

    Selecionar o modelo base

    20 min

    Execute a grade de modelos × prompts como experimentos do Langfuse e escolha o vencedor pelo custo por resposta correta.

  3. 02

    Medir a qualidade

    15 min

    Vá além de “ele venceu”: precisão por nível, sinal llm_judge e traces individuais do prompt ao SQL gerado.

  4. 03

    Melhorar continuamente

    20 min

    Transforme respostas revisadas em novas perguntas douradas pela fila de anotação e execute novamente a grade.

  5. 04

    Liberar para produção

    15 min

    Sirva a configuração vencedora por uma API real e acompanhe traces, sessões, custos e feedback positivo/negativo em produção.

Autoguiado por padrão. Cada módulo informa o checkpoint inicial e termina com uma verificação que você mesmo pode conferir; ninguém fica preso ao ritmo da sala.

Antes de participar

Para quem é e o que levar.

Para quem é público

  • Engenheiros e arquitetos prestes a escolher um modelo para uma funcionalidade com agentes
  • Quem já ouviu “por que este modelo?” e quer uma resposta defensável
  • Equipes criando avaliação de LLM pela primeira vez
  • É preciso se sentir à vontade com SQL e terminal — não é necessário conhecimento de ML

O que levar pré-requisitos

  • Python 3.11 e Node 18+ no notebook
  • Um serviço ClickHouse Cloud com créditos de avaliação
  • Um projeto Langfuse Cloud
  • Uma chave de API do OpenRouter — um endpoint compatível com OpenAI atende todos os modelos da lista, sem credenciais separadas por provedor

Como funciona formato

  • 100% prático em cinco módulos — todos os comandos e consultas são copiar e colar
  • Totalmente autoguiado, com uma trilha de instrutor que espelha cada módulo
  • A avaliação roda no seu projeto Langfuse, portanto as evidências ficam com você
  • A lista usa modelos deliberadamente econômicos — NL→SQL não exige modelos de fronteira

Pronto para realizar a competição?

Traga uma avaliação do ClickHouse Cloud, um projeto Langfuse e uma chave do OpenRouter. Saia sabendo qual modelo implantar, quanto custa cada resposta correta e como provar tudo novamente no próximo trimestre.

18Configurações de modelo × prompt avaliadas em uma execução.
US$ 0Créditos de avaliação e uma lista econômica cobrem a sessão.
SeuO harness é seu para usar com suas próprias perguntas.
PT