品質出力評価¶
品質出力評価は、大規模モデルの出力が期待どおりかを確認するための機能です。評価ルールを設定することで、本番環境のモデル呼び出しや指定範囲のデータに対して評価を実行し、スコアやルールのヒット結果を確認できます。
現在、Prompt Eval と Schema Eval の2つの評価タイプをサポートしています。
評価器を作成¶
Agent モニタリング > 評価 に移動し、評価器を作成 をクリックします。
次の情報を設定します。
- 評価器の Skill テンプレートを選択します。
- 評価対象のタイプを選択します。
- 評価入力と判定ルールを設定します。
- テストデータを使用して試行実行します。
- 結果が期待どおりであることを確認し、評価器を公開します。
Prompt Eval¶
Prompt Eval は、プロンプトを使用してモデルの入力または出力を判定します。コンテンツ品質、関連性、完全性、安全性などの評価シナリオに適しています。
設定時には、以下を指定する必要があります。
- 評価プロンプト
- 評価結果とスコアリングルール
プロンプトには、評価目標、判定基準、返却形式を明確に記述し、評価結果が安定するようにすることを推奨します。
Schema Eval¶
Schema Eval は、モデル出力が指定されたデータ構造に準拠しているかをチェックします。モデルに JSON やその他の構造化コンテンツの返却を求めるシナリオに適しています。
設定時には、対象の Schema を指定する必要があります。評価を実行すると、システムは出力内容のフィールド、タイプ、構造が要件を満たしているかを確認します。
評価器のテスト¶
評価器を公開する前に、テストデータを入力して試行実行を実行できます。
テスト結果には、評価出力、スコア、または構造検証結果が表示されます。結果に基づいてプロンプト、Schema、判定ルールを調整し、再テストできます。
テストが完了したら、公開 をクリックすると、評価器を正式な評価タスクで使用できます。
評価の実行¶
オンライン評価¶
オンライン評価は、本番環境で生成されたモデル呼び出しデータを継続的にチェックするために使用します。
対象のアプリケーションと評価器を選択し、評価対象のデータ範囲を設定します。タスクを有効化すると、システムは設定に基づいて条件に一致するデータに対して評価を実行します。
バッチ評価¶
バッチ評価は、指定した時間範囲または検索条件に該当する過去のモデル呼び出しデータを評価するために使用します。
バッチ評価タスクを作成するときは、次の手順を実行します。
- 対象のアプリケーションを選択します。
- 時間範囲と絞り込み条件を設定します。
- 使用する評価器を選択します。
- 内容を確認して評価タスクを開始します。
評価結果の確認¶
評価結果ページでは、以下を確認できます。
- 評価器と評価方法
- 評価ステータス
- スコアまたはルール検証結果
- モデルの入力と出力
- 評価日時
- 失敗理由
アプリケーション、評価器、評価ステータス、時間範囲などの条件で評価結果を絞り込むことができます。
Note
評価結果は、モデル出力、評価プロンプト、Schema 設定によって異なります。評価タスクを正式に有効化する前に、代表的なテストデータを使用して評価器の効果を検証することを推奨します。
手動アノテーション¶
手動アノテーションを使用すると、モデルの入力、出力、呼び出しチェーンを組み合わせて評価結果を再確認し、サンプルをデータセットに追加できます。
アノテーションキューを作成¶
Trace の検索条件に基づいて、未アノテーションのキューを作成します。失敗や Agent の判定異常などをマークしたデータをサポートします。
キューには、未アノテーション、完了、スキップの件数と現在の処理進捗が表示されます。キューは共有の未アノテーションリストを使用します。担当者の割り当て、受領、仲裁フローは現在サポートされていません。
アノテーションを提出¶
アノテーションワークベンチで、入力、出力、呼び出しチェーン、ツール呼び出し、ユーザーフィードバック、既存の評価結果を確認し、以下を入力します。
| アノテーション内容 | 入力要件 |
|---|---|
| Pass / Fail | 必須 |
| スコア | 任意、1〜5点をサポート |
| 問題タイプ | Fail を選択した場合は必須 |
| 参考回答、メモ、タグ | 任意 |
入力が完了したら、「保存して次へ」を選択してアノテーションを続行するか、「保存して Dataset に追加」を選択してサンプルを蓄積できます。
再度アノテーションを行うと、履歴が保持されます。手動アノテーションの結果には出所が示され、プラットフォームの評価結果や外部の Score と区別して表示されます。
データセット¶
データセットは、本番 Trace 条件と手動アノテーション条件から形成され、サンプルを一元管理し、バッチ評価を実行するために使用します。
バッチ評価を開始¶
データセット内のサンプルを選択し、バッチ評価を開始します。タスク開始時に対象のサンプル範囲が固定されるため、その後のデータセットメンバーの変更は実行中のタスクに影響しません。
権限について¶
アノテーションキューを作成し、手動アノテーションを提出するにはアノテーション権限が必要です。バッチ評価を実行するには評価実行権限が必要です。データセット、アノテーション、評価結果はすべて、現在のワークスペースおよび元の Trace のアクセス権限に従います。