ClickHouse Seri Use-Case

Tentukan pemenangnya.
Buktikan biayanya.

Dalam 90 menit Anda menjalankan kontes sendiri — enam model di tiga strategi prompt, menjawab pertanyaan bisnis nyata dalam SQL di atas ClickHouse — lalu memilih yang layak dirilis berdasarkan bukti: biaya per jawaban benar, bukan leaderboard publik.

90 menit · awal sampai selesai18 konfigurasi dinilaiLangfuse sejak langkah 0$0 pakai kredit trial

Bukan leaderboard publik. Kontes Anda sendiri.

Memilih model adalah keputusan berkonsekuensi pertama dalam aplikasi agent, dan paling sering ditebak-tebak. Tebak terlalu tinggi, Anda membayar harga frontier untuk kemampuan yang tidak pernah dibutuhkan tugasnya. Tebak terlalu rendah, Anda merilis sesuatu yang diam-diam salah pada workload Anda yang sebenarnya.

Jadi Anda menjalankan kontesnya sendiri. Grid enam model di tiga strategi prompt menjawab satu set pertanyaan bisnis ber-ground-truth di atas dataset ClickHouse yang live.

Setiap jawaban dinilai dengan akurasi eksekusi — apakah query-nya mengembalikan hasil yang benar, bukan SQL yang tampak benar — dan setiap konfigurasi diperingkat berdasarkan biaya per jawaban benar. Itulah kualitas per dolar untuk tugas Anda, satu-satunya angka yang benar-benar bisa menyelesaikan perdebatan.

Langfuse sudah tersambung sejak modul 00, bukan ditempel di akhir: ia menjalankan kontes sebagai experiment, menilainya dengan code evaluator dan LLM judge, menyimpan setiap trace, dan mengikuti pemenangnya sampai ke produksi.

Yang Anda bawa pulang

Semua yang sudah berjalan di akhir sesi.

Di trial ClickHouse Cloud Anda sendiri, project Langfuse Anda sendiri, dan satu key OpenRouter.

01

Satu kontes, dijalankan dan diputuskan

Delapan belas konfigurasi model × prompt dinilai terhadap golden question Anda dan diperingkat berdasarkan biaya per jawaban benar.

02

Experiment dan evaluator Langfuse

Satu evaluator kebenaran dan satu LLM judge berjalan server-side di project Langfuse Anda sendiri, menilai setiap run.

03

Penilaian yang bisa Anda pertahankan

Jawaban dibandingkan dengan result set golden yang di-cache — posisi kolom, pembulatan float, normalisasi row-set — sehingga query yang cuma terlihat benar tidak bisa lolos.

04

Loop perbaikan berkelanjutan

Jawaban yang sudah ditinjau menjadi golden question baru dan grid dijalankan ulang — seluruh loop-nya terlihat end to end di Langfuse.

05

Pemenangnya di produksi

Konfigurasi pemenang live di balik POST /ask, ter-trace per sesi, dengan thumbs-up/thumbs-down yang ditulis balik sebagai score Langfuse.

+

Seluruh repo

Harness, agent, SQL guard read-only, API serving dan UI arena — milik Anda untuk diarahkan ke data Anda sendiri.

Rutenya · ~90 menit hands-on

Lima perhentian, berurutan.

Satu alur, awal sampai selesai: pilih model berdasarkan bukti, pahami, perbaiki, lalu pantau di produksi.

  1. 00

    Setup

    20 menit

    Sambungkan OpenRouter, ClickHouse Cloud, dan Langfuse — tracing aktif sebelum satu model pun dipilih — lalu seed dataset arena.

  2. 01

    Pilih model dasarnya

    20 menit

    Jalankan grid model × prompt sebagai experiment Langfuse dan tentukan pemenangnya berdasarkan biaya per jawaban benar.

  3. 02

    Ukur kualitasnya

    15 menit

    Lebih jauh dari “dia menang”: akurasi per tier, signal llm_judge, dan trace individual dari prompt sampai SQL yang dihasilkan.

  4. 03

    Perbaiki terus-menerus

    20 menit

    Ubah jawaban yang sudah ditinjau menjadi golden question baru lewat annotation queue, lalu jalankan ulang grid-nya.

  5. 04

    Rilis ke produksi

    15 menit

    Sajikan konfigurasi pemenang di balik API sungguhan dan pantau trace produksi, sesi, biaya, serta feedback thumbs-up/thumbs-down.

Mandiri secara default. Setiap modul menyebut checkpoint awalnya dan diakhiri verifikasi yang bisa Anda periksa sendiri, jadi tidak ada yang tertinggal karena tempo ruangan.

Sebelum Anda ikut

Untuk siapa, dan apa yang perlu dibawa.

Untuk siapa audiens

  • Engineer dan arsitek yang akan memilih model untuk fitur berbasis agent
  • Siapa pun yang pernah ditanya “kenapa model ini?” dan ingin jawaban yang bisa dipertahankan
  • Tim yang baru pertama kali menyiapkan evaluasi LLM
  • Nyaman dengan SQL dan terminal — tidak perlu latar belakang ML

Yang perlu dibawa prasyarat

  • Python 3.11 dan Node 18+ di laptop Anda
  • Satu service ClickHouse Cloud dengan kredit trial
  • Satu project Langfuse Cloud
  • Satu API key OpenRouter — satu endpoint OpenAI-compatible menaungi semua model di daftar, jadi tidak ada kredensial per provider yang perlu diurus

Cara jalannya format

  • 100% hands-on di lima modul — setiap perintah dan query bisa copy-paste
  • Sepenuhnya mandiri, dengan jalur instructor yang mencerminkan setiap modul untuk fasilitator
  • Penilaian berjalan di project Langfuse Anda, jadi buktinya tetap milik Anda
  • Daftar modelnya sengaja murah — NL→SQL tidak butuh model frontier

Siap menjalankan kontesnya?

Bawa trial ClickHouse Cloud, project Langfuse, dan satu key OpenRouter. Pulang dengan tahu model mana yang layak dirilis, berapa biayanya per jawaban benar, dan cara membuktikannya lagi kuartal depan.

18Konfigurasi model × prompt dinilai dalam satu kali run.
$0Kredit trial dan daftar model murah menutup seluruh sesi.
Milik AndaHarness-nya milik Anda untuk diarahkan ke pertanyaan Anda sendiri.
ID