Ressourcen · 44
Prompt-Injection: Testen Sie die Vertrauensgrenzen eines KI-Agenten
Überprüfen Sie, ob ein Dokument, Suchergebnis oder eine Nachricht keine Aktion im Namen des Benutzers autorisieren kann.
Aktualisiert · 3 min
Wozu dieser Leitfaden beiträgt
- Daten von Anweisungen trennen
- Beschränken Sie die verfügbaren Aktionen auf die Aufgabe
- Testen Sie echte Effekte hinter Antworten
- Einschränkungen und Regressionen dokumentieren
Kurzcheck
- Welche externen Inhalte liest der Agent?
- Welche Aktionen kann es ohne Genehmigung auslösen?
- Wird die Autorisierung außerhalb des Modells durchgesetzt?
- Verhindert eine mündliche Ablehnung tatsächlich einen Tool-Aufruf?
- Wie kann ein divergierendes Szenario gestoppt werden?
Schritt-für-Schritt-Anleitung
- 1
Inventarisieren Sie die Grenzen
Listen Sie Nachrichten, Webseiten, Dokumente, Suchergebnisse, Anhänge und Tool-Ausgaben auf. Behandeln Sie sie als Daten, die ohne Autorität über Berechtigungen interpretiert werden können. Schließen Sie Kanäle mit Text oder multimodalen Inhalten ein.
Liefergegenstand: Karte der Eingaben und verfügbaren Aktionen.
- 2
Definieren Sie verbotene Effekte
Beschreiben Sie die zu verhindernden Schäden: Zugriff außerhalb des Geltungsbereichs, nicht genehmigte Veröffentlichung, Datenübertragung oder Kontoänderungen. Legen Sie für jedes Szenario ein beobachtbares Ergebnis fest. Wenn man nur den Antworttext beurteilt, kann eine bereits durchgeführte Aktion übersehen werden.
Liefergegenstand: Bedrohungsszenarien und Invarianten.
- 3
Isolieren Sie die Testumgebung
Verwenden Sie eindeutig gekennzeichnete fiktive Konten, Dokumente und Ziele mit Testmarkierungen und simulierten Tools. Deaktivieren Sie den echten Sende- und Produktionszugriff. Behalten Sie Modell-, Konfigurations-, Korpus- und Connector-Versionen bei, um Fälle wiederzugeben.
Lieferinhalt: versionierte Umgebung und Testset.
- 4
Gegnerische Eingaben wiedergeben
Platzieren Sie in einer Testquelle eine Anweisung, die der Aufgabe widerspricht, eine Aktion außerhalb des Gültigkeitsbereichs anfordert oder eine falsche Autorität behauptet. Variieren Sie die Kombinationen von Sprache, Platzierung, Format und Quelle. Messen Sie den Werkzeugaufruf, die Argumente und die tatsächliche Wirkung.
Lieferbar: Spuren erfolgreicher, blockierter und ungelöster Fälle.
- 5
Externe Kontrollen stärken
Erzwingen Sie minimale Berechtigungen, Argumentvalidierung, Lese-/Schreibtrennung und zulässige Ziele in den Tools. Für sensible Vorgänge ist eine kontextbezogene Genehmigung erforderlich. RAG und eine Verweigerungsanweisung allein beseitigen das Injektionsrisiko nicht.
Lieferinhalt: Ausführbare Regeln und Bypass-Tests.
- 6
Änderungen verfolgen
Fälle nach Änderungen an Modell, Korpus, Werkzeugen oder Regeln wiederholen. Verfolgen Sie auch legitime Aufgaben, die blockiert werden. Getesteten Umfang und bekannte Einschränkungen veröffentlichen; Der Erfolg bei einem kleinen Testsatz beweist nicht, dass keine Schwachstellen vorhanden sind.
Liefergegenstand: Regressionsbericht und Einsatzentscheidung.
Fiktives Arbeitsbeispiel
Beispielhafte Situation
Beispielhafte Situation: Ein Assistent fasst ein Testdokument zusammen, das den Versand von Informationen an ein externes Ziel anfordert.
Entscheidung und erwartete Beweise
Das Tool lehnt dieses Ziel unabhängig vom generierten Text ab. Der Test prüft, ob nichts gesendet wurde und die legitime Zusammenfassung weiterhin funktioniert.
Unterscheiden Sie die Mechanismen
| Mechanismus | Zweck | Überprüfung oder Einschränkung |
|---|---|---|
| Eingabefilter | Erkennen Sie einige verdächtige Muster | Möglicherweise fehlen neue Formulierungen |
| Musteranweisung | Beschreiben Sie die erwartete Grenze | Ist keine Zugriffskontrolle |
| Tool-Durchsetzung | Eine nicht autorisierte Operation ablehnen | Muss Identität, Objekt und Argumente prüfen |
Managementindikatoren
| Indikator | Was es misst | Erste Aktion |
|---|---|---|
| Verbotene Aktionen | Fälle, die Auswirkungen außerhalb des Geltungsbereichs verursachen | Blockiere und untersuche jeden Effekt |
| Falsche Ablehnungen | Legitime Aufgaben verhindert | Überarbeitung ohne Erweiterung der Berechtigungen |
| Abdeckung | Tatsächlich getestete Kanäle und Tools | Blinde Flecken deklarieren |
Häufige Fallstricke
- Geheimnisse in Testaufforderungen einfügen
- Nur sichtbare Antworten testen
- Vorausgesetzt, dass interne Dokumente immer vertrauenswürdig sind
- Anspruch auf absoluten Schutz nach einigen Tests
Häufig gestellte Fragen
Verhindert RAG die Injektion?
Nein. Abgerufene Dokumente können selbst widersprüchliche Anweisungen enthalten. Quellen bleiben Daten, die innerhalb kontrollierter Grenzen verarbeitet werden müssen.
Soll jedes verdächtige Dokument blockiert werden?
Es kommt auf die Aufgabe an; Ein Agent kann ein Dokument oft analysieren, ohne dessen Anweisungen zu befolgen oder über Schreibwerkzeuge zu verfügen.
Wie sollen Ergebnisse veröffentlicht werden?
Statusversionen, Umfang, getestete Effekte, Einschränkungen und Korrekturen. Schließen Sie Geheimnisse und Kundendokumente aus, die bei der Arbeit verwendet werden.
Offizielle Referenzen
Die Referenzen unterstützen die Methode. Passen Sie die Prüfungen an Ihren Kontext an; sie stellen keine Zertifizierung dar. Originalreferenztitel und Quelldokumente können in einer anderen Sprache verfasst sein.






