Bronnen · 44
Promptinjectie: test de vertrouwensgrenzen van een AI-agent
Controleren of een document, zoekresultaat of bericht geen actie namens de gebruiker kan autoriseren.
Bijgewerkt · 3 min
Wat deze handleiding helpt bereiken
- Scheid data van instructies
- Beperk beschikbare acties tot de taak
- Test de werkelijke effecten achter reacties
- Documenteer beperkingen en regressies
Snelle controle
- Welke externe inhoud leest de agent?
- Welke acties kan de agent uitvoeren zonder goedkeuring?
- Wordt autorisatie buiten het model afgedwongen?
- Voorkomt een mondelinge weigering daadwerkelijk een toolaanroep?
- Hoe kan een divergerend scenario worden gestopt?
Stapsgewijze methode
- 1
Inventariseer de grenzen
Maak een lijst van berichten, webpagina's, documenten, zoekresultaten, bijlagen en tooluitvoer. Behandel deze als gegevens die moeten worden geïnterpreteerd zonder autoriteit over machtigingen. Neem kanalen met tekst of multimodale inhoud mee.
Resultaat: kaart van invoer en beschikbare acties.
- 2
Definieer verboden effecten
Beschrijf de schade die moet worden voorkomen: toegang buiten het toepassingsgebied, ongeautoriseerde publicatie, gegevensoverdracht of accountwijzigingen. Stel een waarneembaar resultaat in voor elk scenario; het beoordelen van alleen de antwoordtekst kan een reeds uitgevoerde actie missen.
Resultaat: dreigingsscenario's en invarianten.
- 3
Isoleer de testomgeving
Gebruik duidelijk gelabelde fictieve accounts, documenten en bestemmingen met testmarkeringen en gesimuleerde tools. Schakel het verzenden van echte berichten en toegang tot de productieomgeving uit. Bewaar model-, configuratie-, corpus- en connectorversies om gevallen te kunnen herhalen.
Resultaat: versiebeheerde omgeving en testset.
- 4
Vijandige invoer opnieuw afspelen
Plaats in een testbron een instructie die de taak tegenspreekt, een actie buiten het toepassingsgebied aanvraagt of valse autoriteit claimt. Varieer taal, plaatsing, formaat en broncombinaties. Meet de aanroep van de tool, argumenten en het daadwerkelijke effect.
Resultaat: traceringen van succesvolle, geblokkeerde en onopgeloste gevallen.
- 5
Externe controles versterken
Dwing minimale machtigingen, argumentvalidatie, lees-/schrijfscheiding en toegestane bestemmingen af in de tools. Vereis contextuele goedkeuring voor gevoelige bewerkingen. RAG en een weigeringsinstructie alleen elimineren het injectierisico niet.
Resultaat: uitvoerbare regels en bypass-tests.
- 6
Wijzigingen bijhouden
Speel gevallen opnieuw af na wijzigingen in model, corpus, tools of regels. Houd ook legitieme taken bij die worden geblokkeerd. Publiceer het geteste toepassingsgebied en bekende beperkingen; succes op een kleine testset bewijst niet de afwezigheid van kwetsbaarheden. Resultaat
Oplevering: regressierapport en implementatiebesluit.
Fictief uitgewerkt voorbeeld
Illustratieve situatie
Illustratieve situatie: een assistent vat een testdocument samen waarin wordt gevraagd om informatie naar een externe bestemming te sturen.
Beslissing en verwachte bewijs
De tool weigert die bestemming onafhankelijk van de gegenereerde tekst. De test controleert of er niets is verzonden en de legitieme samenvatting werkt nog steeds.
Onderscheid de mechanismen
| Mechanisme | Doel | Verificatie of beperking |
|---|---|---|
| Invoerfilter | Verdachte patronen detecteren | Nieuwe formulering mogelijk missen |
| Modelinstructie | De verwachte grens beschrijven | Geen toegangscontrole |
| Handhaving van tools | Een ongeautoriseerde bewerking afwijzen | Identiteit, object en argumenten moeten worden gecontroleerd |
Managementindicatoren
| Indicator | Wat het meet | Eerste actie |
|---|---|---|
| Verboden acties | Gevallen die effecten buiten het toepassingsgebied veroorzaken | Elk effect blokkeren en onderzoeken |
| Valse weigeringen | Legitieme taken voorkomen | Herzien zonder de machtigingen uit te breiden |
| Dekking | Kanalen en tools daadwerkelijk getest | Blinde vlekken aangeven |
Veelvoorkomende fouten
- Geheimen in testprompts plaatsen
- Alleen zichtbare antwoorden testen
- Ervan uitgaan dat interne documenten altijd worden vertrouwd
- Absolute bescherming claimen na een paar Tests
Veelgestelde vragen
Voorkomt RAG injectie?
Nee. Opgehaalde documenten kunnen zelf vijandige instructies bevatten. Bronnen blijven gegevens die binnen gecontroleerde grenzen verwerkt moeten worden.
Moet elk verdacht document worden geblokkeerd?
Dat hangt af van de taak; een agent kan een document vaak analyseren zonder de instructies te volgen of schrijfgereedschappen te hebben.
Hoe moeten resultaten worden gepubliceerd?
Vermeld versies, reikwijdte, geteste effecten, beperkingen en oplossingen. Sluit geheimen en klantdocumenten die in het werk zijn gebruikt uit.
Officiële referenties
Referenties ondersteunen de methode. Pas controles aan uw context aan; ze zijn geen certificering. Originele referentietitels en brondocumenten kunnen in een andere taal zijn.






