リソース · 44

プロンプトの挿入:AIエージェントの信頼境界をテストする

ドキュメント、検索結果、またはメッセージがユーザーに代わってアクションを承認できないことを確認する。

更新済み · 4 min

このガイドが達成するのに役立つこと

  • データと命令を分離する。
  • 利用可能なアクションをタスクに限定する。
  • 応答の背後にある実際の効果をテストする。
  • 制限事項と回帰を文書化する。

クイックチェック

  • エージェントはどの外部コンテンツを読み込むか?
  • 承認なしでトリガーできるアクションは何か?
  • 認証はモデルの外部で強制されているか?
  • 口頭での拒否は実際にツール呼び出しを阻止するか?
  • 分岐シナリオをどのように停止できるか?

手順

  1. 1

    境界のインベントリ

    メッセージ、Webページ、ドキュメント、検索結果、添付ファイル、ツール出力の一覧を作成します。 これらを、権限を介さずに解釈するデータとして扱います。 テキストまたはマルチモーダルコンテンツを伝送するチャネルを含めます。

    成果物:入力と利用可能なアクションのマップ

  2. 2

    禁止される影響の定義

    防止すべき危害(範囲外アクセス、承認されていない公開、データ転送、アカウント変更など)を記述します。 各シナリオに対して観測可能な結果を​​設定します。 回答テキストのみを判断すると、既に実行されたアクションを見落とす可能性があります。

    成果物:脅威シナリオと不変条件

  3. 3

    テスト環境の分離

    テストマーカーとシミュレーションツールを用いて、明確にラベル付けされた架空のアカウント、ドキュメント、宛先を使用します。 実際の送信と本番環境へのアクセスを無効にします。 ケースを再現するために、モデル、構成、コーパス、コネクタのバージョンを保持します。

    成果物:バージョン管理された環境とテストセット

  4. 4

    攻撃的な入力の再現

    テストソースに、タスクに矛盾する命令、スコープ外のアクションを要求する命令、または虚偽の権限を主張する命令を挿入する。 言語、配置、フォーマット、ソースの組み合わせを変化させる。 ツールの呼び出し、引数、および実際の影響を測定する。

    成果物:成功したケース、ブロックされたケース、および未解決のケースのトレース。

  5. 5

    外部制御の強化

    ツールにおいて、最小限の権限、引数の検証、読み書きの分離、および許可された宛先を強制する。 機密性の高い操作には、状況に応じた承認を要求する。 RAGと拒否命令だけでは、インジェクションのリスクは排除されない。

    成果物:実行可能なルールとバイパステスト。

  6. 6

    変更の追跡

    モデル、コーパス、ツール、またはルールの変更後にケースを再現する。 ブロックされた正当なタスクも追跡する。 テスト範囲と既知の制限を公開する。 小規模なテストセットでの成功は、脆弱性の不在を証明するものではない。

    成果物:回帰分析レポートおよび導入決定。

架空の事例

具体的な状況

例:アシスタントが、外部宛先への情報送信を要求するテスト文書を要約します。

決定と期待される証拠

ツールは、生成されたテキストとは無関係に、その宛先を拒否します。 テストでは、何も送信されなかったこと、そして正当な要約が機能することを確認します。

メカニズムの区別

メカニズム目的検証または制限
入力フィルタ疑わしいパターンを検出する新しい文言を見落とす可能性がある
モデル指示想定される境界を記述するアクセス制御ではない
ツールによる強制不正な操作を拒否するID、オブジェクト、引数をチェックする必要がある

管理指標

指標測定対象最初のアクション
禁止されている操作範囲外の影響を引き起こすケースすべての影響をブロックして調査する
誤った拒否正当なタスクが妨げられる権限を拡大せずに改訂する
網羅性実際にテストされたチャネルとツール盲点を宣言する

よくある間違い

  • テストプロンプトに秘密情報を含める
  • 表示される回答のみをテストする
  • 内部文書は常に信頼できると想定する
  • 数回のテストで絶対的な保護を主張する

よくある質問

RAGはインジェクション攻撃を防止しますか?

いいえ。取得した文書自体に攻撃的な指示が含まれている可能性があります。 ソースは、管理された範囲内で処理されるべきデータとして残ります。

疑わしい文書はすべてブロックすべきですか?

タスクによります。 エージェントは、指示に従ったり書き込みツールを使用したりしなくても、文書を分析できる場合が多くあります。

結果はどのように公開すべきですか?

バージョン、範囲、テストされた効果、制限事項、修正点を明記してください。 作業で使用された機密情報やクライアント文書は除外してください。

公式参照文献

参照文献はメソッドを裏付けるものです。 チェックは状況に合わせて調整してください。 これらは認証ではありません。 元の参照文献のタイトルやソース文書は別の言語で書かれている場合があります。