Langfuse WorkshopClickHouse Workshops

06 実験

学習者ガイド: 06 実験

ワークショップ資料は公開されている langfuse/langfuse-workshop リポジトリで管理されています。実行可能なアプリケーション、チェックポイント ブランチ、ローカル セットアップはリポジトリを参照してください。

このマークダウン ファイルを表示

学習者ガイド: 06 実験

インストラクター ノート

  • 重要なアイデアは再利用です: 実験ランナーは Web アプリと同じ runSupportConversation(...) を呼び出します。
  • スクリプト内の確定的スコアリング (keyword_overlap) を LLM に基づく判定スコアリング (correctness) と対比してください。
  • Correctness セットアップの前にデフォルト評価器モデルを確認してください。学習者がセッション 4 で設定していなかった場合、最初に Project Settings → LLM Connections に送ってください。
  • 混合セットアップを強調してください: スクリプトは安い確定的なチェックを所有し、Langfuse はセマンティック判定を所有しています。
  • ワークショップのトレースと最終実行サマリーを簡単に追跡できるようにするには、同時実行性を 1 に保ってください。

デモ リズム

  1. scripts/run-dataset.ts の番号付きセクションをスキムします。
  2. スクリプト内の keyword_overlap 評価器を指摘します。
  3. Correctness 評価器をデータセット実行評価器として設定します。
  4. npm run dataset:run を実行します。
  5. 実行テーブル、項目ごとのトレース、チャート ビューを開きます。

注視する点

  • Correctness 評価器ターゲット。実行行と実行比較に表示される スコアが欲しい場合は Run on を Experiments に設定したままにしてください。
  • 他のすべてを設定する前に学習者に Run on をデフォルトの Observations から Experiments に切り替えるよう指示してください。
  • 実験実行がまだ存在しない場合、レビュー テーブルまたはプロンプト プレビューが空である場合があります。npm run dataset:run が最初の実行を作成する前はこれが予想されます。
  • Correctness 評価器マッピングは 3 つの異なるソース ドロップダウンを使用します: query は $.messages[-1].content を持つ Input です。generation は JsonPath なしの Output で、ground_truth は $.idealAnswer を持つ Expected Output です。
  • 一般的な誤構成は、すべての 3 つの変数を Input に保つことで、評価器が毎回間違ったデータを読み取るようにサイレント制御します。
  • 学習者が確定的チェックが Langfuse に存在する必要があると仮定する場合。そうではありません。代替として code-evaluator ドキュメントについてのみ言及してください。
  • "デフォルト モデルが設定されていません" は Langfuse が LLM 接続/デフォルト評価器モデルを必要とすることを意味します。.env を編集して修正されません。
  • 遅い非同期評価器の結果。コンソールは最終サマリーのみを表示するため、correctness がまだ保留中である場合は実行完了後に Langfuse をリフレッシュしてください。

このページの内容

JA