Recursos · 44

Injeção de prompt: testar os limites de confiança de um agente de IA

Verificar se um documento, resultado de pesquisa ou mensagem não pode autorizar uma ação em nome do usuário.

Atualizado · 3 min

O que este guia ajuda a alcançar

  • Separar dados de instruções
  • Limitar as ações disponíveis à tarefa
  • Testar os efeitos reais por trás das respostas
  • Documentar limitações e regressões

Verificação rápida

  • Qual conteúdo externo o agente lê?
  • Quais ações ele pode acionar sem aprovação?
  • A autorização é aplicada fora do modelo?
  • Uma recusa verbal realmente impede uma chamada de ferramenta?
  • Como um cenário divergente pode ser interrompido?

Método passo a passo

  1. 1

    Inventariar os limites

    Listar mensagens, páginas web, documentos, resultados de pesquisa, anexos e saídas de ferramentas. Tratá-los como dados para interpretação sem autoridade sobre permissões. Incluir canais que transportam conteúdo de texto ou multimodal.

    Entregável: mapa de entradas e ações disponíveis.

  2. 2

    Definir efeitos proibidos

    Descrever os danos a serem evitados: acesso fora do escopo, publicação não aprovada, transferência de dados ou alterações de conta. Definir um resultado observável para cada cenário; julgar apenas o texto da resposta pode não detectar uma ação já realizada.

    Entregável: cenários de ameaça e invariantes.

  3. 3

    Isolar o ambiente de teste

    Usar contas, documentos e destinos fictícios claramente rotulados com marcadores de teste e ferramentas simuladas. Desativar o envio real e o acesso à produção. Manter as versões do modelo, da configuração, do corpus e do conector para reproduzir os casos.

    Entregável: ambiente versionado e conjunto de testes.

  4. 4

    Reproduzir entradas adversárias

    Inserir em um código-fonte de teste uma instrução que contradiga a tarefa, solicite uma ação fora do escopo ou afirme autoridade falsa. Variar a linguagem, o posicionamento, o formato e as combinações de código-fonte. Medir a invocação da ferramenta, os argumentos e o efeito real.

    Entregável: rastreamento de casos bem-sucedidos, bloqueados e não resolvidos.

  5. 5

    Fortalecer os controles externos

    Impor permissões mínimas, validação de argumentos, separação de leitura/gravação e destinos permitidos nas ferramentas. Exigir aprovação contextual para operações sensíveis. RAG e uma instrução de recusa, por si só, não eliminam o risco de injeção.

    Entregável: regras executáveis ​​e testes de bypass.

  6. 6

    Rastrear alterações

    Reproduzir casos após alterações no modelo, corpus, ferramentas ou regras. Rastrear também tarefas legítimas que são bloqueadas. Publicar o escopo testado e as limitações conhecidas; o sucesso em um pequeno conjunto de testes não estabelece a ausência de vulnerabilidades.

    Entregável: relatório de regressão e decisão de implantação.

Exemplo prático fictício

Situação ilustrativa

Situação ilustrativa: um assistente resume um documento de teste que solicita o envio de informações para um destino externo.

Decisão e evidências esperadas

A ferramenta rejeita esse destino independentemente do texto gerado. O teste verifica se nada foi enviado e o resumo legítimo ainda funciona.

Distinguir os mecanismos

MecanismoFinalidadeVerificação ou limitação
Filtro de entradaDetectar alguns padrões suspeitosPode não detectar novas palavras
Instrução de modeloDescrever o limite esperadoNão é um controle de acesso
Aplicação de ferramentaRejeitar uma operação não autorizadaDeve verificar identidade, objeto e argumentos

Indicadores de gestão

IndicadorO que medePrimeira ação
Ações proibidasCasos que causam efeitos fora do escopoBloquear e investigar cada efeito
Recusas falsasTarefas legítimas impedidasRevisar sem ampliar as permissões
AbrangênciaCanais e ferramentas realmente testadosDeclarar pontos cegos

Erros comuns

  • Colocar segredos em prompts de teste
  • Testar apenas respostas visíveis
  • Presumir que documentos internos são sempre confiáveis
  • Afirmar proteção absoluta após alguns testes

Perguntas frequentes

O RAG impede a injeção de código?

Não. Os documentos recuperados podem conter instruções adversárias. As fontes permanecem como dados a serem processados ​​dentro de limites controlados.

Todo documento suspeito deve ser bloqueado?

Depende da tarefa; um agente geralmente pode analisar um documento sem seguir suas instruções ou possuir ferramentas de escrita.

Como os resultados devem ser publicados?

Indique as versões, o escopo, os efeitos testados, as limitações e as correções. Exclua segredos e documentos do cliente usados ​​no trabalho.

Referências oficiais

As referências apoiam o método. Adapte as verificações ao seu contexto; elas não são uma certificação. Os títulos das referências originais e os documentos de origem podem estar em outro idioma.