06 実験
学習者ガイド: 06 実験
ワークショップ資料は公開されている langfuse/langfuse-workshop リポジトリで管理されています。実行可能なアプリケーション、チェックポイント ブランチ、ローカル セットアップはリポジトリを参照してください。
学習者ガイド: 06 実験
インストラクター ノート
- 重要なアイデアは再利用です: 実験ランナーは Web アプリと同じ
runSupportConversation(...)を呼び出します。 - スクリプト内の確定的スコアリング (
keyword_overlap) を LLM に基づく判定スコアリング (correctness) と対比してください。 - Correctness セットアップの前にデフォルト評価器モデルを確認してください。学習者がセッション 4 で設定していなかった場合、最初に Project Settings → LLM Connections に送ってください。
- 混合セットアップを強調してください: スクリプトは安い確定的なチェックを所有し、Langfuse はセマンティック判定を所有しています。
- ワークショップのトレースと最終実行サマリーを簡単に追跡できるようにするには、同時実行性を 1 に保ってください。
デモ リズム
scripts/run-dataset.tsの番号付きセクションをスキムします。- スクリプト内の
keyword_overlap評価器を指摘します。 - Correctness 評価器をデータセット実行評価器として設定します。
npm run dataset:runを実行します。- 実行テーブル、項目ごとのトレース、チャート ビューを開きます。
注視する点
- Correctness 評価器ターゲット。実行行と実行比較に表示される スコアが欲しい場合は Run on を Experiments に設定したままにしてください。
- 他のすべてを設定する前に学習者に Run on をデフォルトの Observations から Experiments に切り替えるよう指示してください。
- 実験実行がまだ存在しない場合、レビュー テーブルまたはプロンプト プレビューが空である場合があります。
npm run dataset:runが最初の実行を作成する前はこれが予想されます。 - Correctness 評価器マッピングは 3 つの異なるソース ドロップダウンを使用します:
queryは$.messages[-1].contentを持つ Input です。generationは JsonPath なしの Output で、ground_truthは$.idealAnswerを持つ Expected Output です。 - 一般的な誤構成は、すべての 3 つの変数を Input に保つことで、評価器が毎回間違ったデータを読み取るようにサイレント制御します。
- 学習者が確定的チェックが Langfuse に存在する必要があると仮定する場合。そうではありません。代替として code-evaluator ドキュメントについてのみ言及してください。
- "デフォルト モデルが設定されていません" は Langfuse が LLM 接続/デフォルト評価器モデルを必要とすることを意味します。
.envを編集して修正されません。 - 遅い非同期評価器の結果。コンソールは最終サマリーのみを表示するため、
correctnessがまだ保留中である場合は実行完了後に Langfuse をリフレッシュしてください。