Bronnen · 44

Promptinjectie: test de vertrouwensgrenzen van een AI-agent

Controleren of een document, zoekresultaat of bericht geen actie namens de gebruiker kan autoriseren.

Bijgewerkt · 3 min

Wat deze handleiding helpt bereiken

  • Scheid data van instructies
  • Beperk beschikbare acties tot de taak
  • Test de werkelijke effecten achter reacties
  • Documenteer beperkingen en regressies

Snelle controle

  • Welke externe inhoud leest de agent?
  • Welke acties kan de agent uitvoeren zonder goedkeuring?
  • Wordt autorisatie buiten het model afgedwongen?
  • Voorkomt een mondelinge weigering daadwerkelijk een toolaanroep?
  • Hoe kan een divergerend scenario worden gestopt?

Stapsgewijze methode

  1. 1

    Inventariseer de grenzen

    Maak een lijst van berichten, webpagina's, documenten, zoekresultaten, bijlagen en tooluitvoer. Behandel deze als gegevens die moeten worden geïnterpreteerd zonder autoriteit over machtigingen. Neem kanalen met tekst of multimodale inhoud mee.

    Resultaat: kaart van invoer en beschikbare acties.

  2. 2

    Definieer verboden effecten

    Beschrijf de schade die moet worden voorkomen: toegang buiten het toepassingsgebied, ongeautoriseerde publicatie, gegevensoverdracht of accountwijzigingen. Stel een waarneembaar resultaat in voor elk scenario; het beoordelen van alleen de antwoordtekst kan een reeds uitgevoerde actie missen.

    Resultaat: dreigingsscenario's en invarianten.

  3. 3

    Isoleer de testomgeving

    Gebruik duidelijk gelabelde fictieve accounts, documenten en bestemmingen met testmarkeringen en gesimuleerde tools. Schakel het verzenden van echte berichten en toegang tot de productieomgeving uit. Bewaar model-, configuratie-, corpus- en connectorversies om gevallen te kunnen herhalen.

    Resultaat: versiebeheerde omgeving en testset.

  4. 4

    Vijandige invoer opnieuw afspelen

    Plaats in een testbron een instructie die de taak tegenspreekt, een actie buiten het toepassingsgebied aanvraagt ​​of valse autoriteit claimt. Varieer taal, plaatsing, formaat en broncombinaties. Meet de aanroep van de tool, argumenten en het daadwerkelijke effect.

    Resultaat: traceringen van succesvolle, geblokkeerde en onopgeloste gevallen.

  5. 5

    Externe controles versterken

    Dwing minimale machtigingen, argumentvalidatie, lees-/schrijfscheiding en toegestane bestemmingen af ​​in de tools. Vereis contextuele goedkeuring voor gevoelige bewerkingen. RAG en een weigeringsinstructie alleen elimineren het injectierisico niet.

    Resultaat: uitvoerbare regels en bypass-tests.

  6. 6

    Wijzigingen bijhouden

    Speel gevallen opnieuw af na wijzigingen in model, corpus, tools of regels. Houd ook legitieme taken bij die worden geblokkeerd. Publiceer het geteste toepassingsgebied en bekende beperkingen; succes op een kleine testset bewijst niet de afwezigheid van kwetsbaarheden. Resultaat

    Oplevering: regressierapport en implementatiebesluit.

Fictief uitgewerkt voorbeeld

Illustratieve situatie

Illustratieve situatie: een assistent vat een testdocument samen waarin wordt gevraagd om informatie naar een externe bestemming te sturen.

Beslissing en verwachte bewijs

De tool weigert die bestemming onafhankelijk van de gegenereerde tekst. De test controleert of er niets is verzonden en de legitieme samenvatting werkt nog steeds.

Onderscheid de mechanismen

MechanismeDoelVerificatie of beperking
InvoerfilterVerdachte patronen detecterenNieuwe formulering mogelijk missen
ModelinstructieDe verwachte grens beschrijvenGeen toegangscontrole
Handhaving van toolsEen ongeautoriseerde bewerking afwijzenIdentiteit, object en argumenten moeten worden gecontroleerd

Managementindicatoren

IndicatorWat het meetEerste actie
Verboden actiesGevallen die effecten buiten het toepassingsgebied veroorzakenElk effect blokkeren en onderzoeken
Valse weigeringenLegitieme taken voorkomenHerzien zonder de machtigingen uit te breiden
DekkingKanalen en tools daadwerkelijk getestBlinde vlekken aangeven

Veelvoorkomende fouten

  • Geheimen in testprompts plaatsen
  • Alleen zichtbare antwoorden testen
  • Ervan uitgaan dat interne documenten altijd worden vertrouwd
  • Absolute bescherming claimen na een paar Tests

Veelgestelde vragen

Voorkomt RAG injectie?

Nee. Opgehaalde documenten kunnen zelf vijandige instructies bevatten. Bronnen blijven gegevens die binnen gecontroleerde grenzen verwerkt moeten worden.

Moet elk verdacht document worden geblokkeerd?

Dat hangt af van de taak; een agent kan een document vaak analyseren zonder de instructies te volgen of schrijfgereedschappen te hebben.

Hoe moeten resultaten worden gepubliceerd?

Vermeld versies, reikwijdte, geteste effecten, beperkingen en oplossingen. Sluit geheimen en klantdocumenten die in het werk zijn gebruikt uit.

Officiële referenties

Referenties ondersteunen de methode. Pas controles aan uw context aan; ze zijn geen certificering. Originele referentietitels en brondocumenten kunnen in een andere taal zijn.