リソース · 09
RAG品質:エビデンスに基づいて知識アシスタントを評価する
コーパス、検索、引用、回答、棄却、およびドリフトを個別に測定することで、真に修正が必要な箇所を把握できます。
更新済み · 4 min
このガイドが達成するのに役立つこと
- 失敗の原因がコーパス、検索、またはモデルにあるかどうかを特定する
- すべての引用を追跡する
- 適切な棄権を報奨する
- 変更後のドリフトを検出する
クイックチェック
- 参照元は承認済みで最新のものか?
- 正しい箇所が上位に表示されているか?
- すべての決定的な主張は裏付けられているか?
- アシスタントは「わからない」と答えることができるか?
- 機密性の高いケースはエスカレーションされているか?
手順
- 1
有用なタスクを定義する
実際の質問、そのバリエーション、および期待されるビジネス結果を収集する。 曖昧さ、情報源の矛盾、期限切れの文書、および範囲外の要求を追加する。
成果物:ケースとリスクの分類体系。
- 2
コーパスをクリーンアップする
すべての情報源に所有者、権限、有効期限、およびステータスを割り当てる。 重複、孤立した断片、および権限が不明な文書を削除する。
成果物:コーパスレジスタ
- 3
検索の評価
最終的な文言を評価する前に、必要な箇所が見つかり、ランク付けされているかを測定する。 証拠が存在しないクエリを検査する。
成果物:網羅性と関連性の指標
- 4
回答と引用の評価
箇所への忠実性、完全性、制限事項、引用と主張の関係、矛盾を指摘する機能を確認する。
成果物:忠実性と有用性の評価基準
- 5
拒否と攻撃のテスト
間接的なデータ注入、禁止されているデータ要求、悪意のあるソース、偽の優先順位文書、および取り消し不可能な操作を追加する。 人的エスカレーションを定義する。
成果物:セキュリティ結果とガードレール
- 6
変更の監視
コーパス、インデックス、設定、モデル、および手順のバージョン管理 変更のたびに安定セットを再生し、不要なデータを保持せずに実際のフィードバックを分析します。
成果物:ドリフトダッシュボードとレビュー手順。
架空の事例
具体的な状況
内部アシスタントは、一部有効期限切れの手順書に基づいて回答します。 テストセットには、定型的な質問、曖昧な質問、回答不可能な質問が含まれています。 各引用は、文書のバージョンと照合されます。
決定と期待される証拠
有効期限切れの情報源が除外され、サポートされていない回答が拒否され、コーパスの所有者が特定されるまで、リリースは待機します。
管理指標
| 指標 | 測定対象 | 最初のアクション |
|---|---|---|
| 検索カバレッジ | 必要なパッセージが見つかった質問 | モデル実行前にコーパス、チャンキング、またはクエリを修正する |
| 忠実性 | 引用元によって真に裏付けられた主張 | 裏付けのない回答をブロックまたは書き換える |
| 有用な棄権 | 証拠のないケースを正しく拒否またはエスカレーションする | 信頼度閾値を調整する |
| 回帰分析 | 同一セット内のバージョン間の品質差 | 原因となる変更を特定する |
よくある間違い
- ライティングの流暢さのみを測定する
- 検索失敗と誤検出を混同する
- 簡単すぎる評価セットを使用する
- 比較せずに複数のコンポーネントを変更する
よくある質問
必要な質問数は?
重要なリスクを網羅する、代表的でバージョン管理されたセットから始める。 多様性と質は、人為的な量よりも重要です。
自動化された指標は1つだけで十分でしょうか?
いいえ。トリアージは迅速化されますが、機密性の高いケース、曖昧なケース、専門分野のケースには、明確な基準と人間のレビューが必要です。
すべての会話を保存すべきでしょうか?
いいえ。目的、アクセス権限、保存期間が明確に定義された、必要な記録のみを保存してください。 改善のためには、匿名化されたケースを優先してください。
公式参照文献
参照文献はメソッドを裏付けるものです。 チェックは状況に合わせて調整してください。 これらは認証ではありません。 元の参照文献のタイトルやソース文書は別の言語で書かれている場合があります。






