Agent ArenaClickHouse Workshops

受講者トラック

セッション中に自分の手を動かして進めるレッスン群です。

こちらは受講者トラックです。ワークショップの中で自分の手を動かして進めるレッスン群です。 各モジュールは前のモジュールの上に積み上がり、Agent Arena の NL→SQL チャットボットを 1 本の流れに沿って導いていきます。ベースモデルを選ぶ → オフラインで測る → リリースして検知する → 人が調査する → 改善を証明して監視する — すべて最初のモジュールから Langfuse で計測し、OpenRouter 経由で配信し、ClickHouse を裏側に置きます。

この道筋は、本気のエージェントを作るときに最も重要な判断から始まります。 どのモデルを使うか。 Module 01 はそれにエビデンスで答えます。Langfuse experiments として 実行され、正答あたりのコストでランク付けされるコンテストです。そしてそれ以降のすべての モジュールが、その選択の上に積み上がります。

モジュールは順番に進めてください:

  • 00 セットアップ — OpenRouter、ClickHouse Cloud、 Langfuse Cloud を接続し、データベースをシードします。
  • 01 ベースモデルを選ぶ — 土台となる判断。 モデル × プロンプトのグリッドを Langfuse experiments として実行し、正答あたりのコストで 勝者を戴冠させます。
  • 02 オフラインで品質を測る — 「勝った」の先へ。 ティアごとの精度、agent-arena-llm-judge score、個々の trace を読み、勝者が実際にどう振る舞うのかを 見ます。
  • 03 リリースして検知する — 選ばれた構成を 古びたビジネスポリシーとともにリリースし、運用 evaluator は通るのに実際のユーザーの 👎 が 盲点をあらわにする様子を見ます。
  • 04 人が調査する — フィードバックのシグナルを使って 正典となる本番の trace を見つけ、人による annotation を完了させ、修正を検証し、その由来を 記録します。
  • 05 ループを閉じる — レビュー済みのインシデントを 昇格させ、対になった experiment でポリシー改善を証明し、汎用のオンライン evaluator を校正して 有効化し、以後のトラフィックについて score とフィードバックの両方を監視します。

各モジュールに対応する講師トラックのノートを含む完全なモジュール表は、トップレベルの 概要 を参照してください。

Track your progress?

Optional. We email a link to confirm your address; progress records once you open it.

Please use your work email address, not a personal one.

Progress tracking also requires accepting the current Terms of Service in Privacy settings.

JA