Recursos · 44
Injeção de prompt: testar os limites de confiança de um agente de IA
Verificar se um documento, resultado de pesquisa ou mensagem não pode autorizar uma ação em nome do usuário.
Atualizado · 3 min
O que este guia ajuda a alcançar
- Separar dados de instruções
- Limitar as ações disponíveis à tarefa
- Testar os efeitos reais por trás das respostas
- Documentar limitações e regressões
Verificação rápida
- Qual conteúdo externo o agente lê?
- Quais ações ele pode acionar sem aprovação?
- A autorização é aplicada fora do modelo?
- Uma recusa verbal realmente impede uma chamada de ferramenta?
- Como um cenário divergente pode ser interrompido?
Método passo a passo
- 1
Inventariar os limites
Listar mensagens, páginas web, documentos, resultados de pesquisa, anexos e saídas de ferramentas. Tratá-los como dados para interpretação sem autoridade sobre permissões. Incluir canais que transportam conteúdo de texto ou multimodal.
Entregável: mapa de entradas e ações disponíveis.
- 2
Definir efeitos proibidos
Descrever os danos a serem evitados: acesso fora do escopo, publicação não aprovada, transferência de dados ou alterações de conta. Definir um resultado observável para cada cenário; julgar apenas o texto da resposta pode não detectar uma ação já realizada.
Entregável: cenários de ameaça e invariantes.
- 3
Isolar o ambiente de teste
Usar contas, documentos e destinos fictícios claramente rotulados com marcadores de teste e ferramentas simuladas. Desativar o envio real e o acesso à produção. Manter as versões do modelo, da configuração, do corpus e do conector para reproduzir os casos.
Entregável: ambiente versionado e conjunto de testes.
- 4
Reproduzir entradas adversárias
Inserir em um código-fonte de teste uma instrução que contradiga a tarefa, solicite uma ação fora do escopo ou afirme autoridade falsa. Variar a linguagem, o posicionamento, o formato e as combinações de código-fonte. Medir a invocação da ferramenta, os argumentos e o efeito real.
Entregável: rastreamento de casos bem-sucedidos, bloqueados e não resolvidos.
- 5
Fortalecer os controles externos
Impor permissões mínimas, validação de argumentos, separação de leitura/gravação e destinos permitidos nas ferramentas. Exigir aprovação contextual para operações sensíveis. RAG e uma instrução de recusa, por si só, não eliminam o risco de injeção.
Entregável: regras executáveis e testes de bypass.
- 6
Rastrear alterações
Reproduzir casos após alterações no modelo, corpus, ferramentas ou regras. Rastrear também tarefas legítimas que são bloqueadas. Publicar o escopo testado e as limitações conhecidas; o sucesso em um pequeno conjunto de testes não estabelece a ausência de vulnerabilidades.
Entregável: relatório de regressão e decisão de implantação.
Exemplo prático fictício
Situação ilustrativa
Situação ilustrativa: um assistente resume um documento de teste que solicita o envio de informações para um destino externo.
Decisão e evidências esperadas
A ferramenta rejeita esse destino independentemente do texto gerado. O teste verifica se nada foi enviado e o resumo legítimo ainda funciona.
Distinguir os mecanismos
| Mecanismo | Finalidade | Verificação ou limitação |
|---|---|---|
| Filtro de entrada | Detectar alguns padrões suspeitos | Pode não detectar novas palavras |
| Instrução de modelo | Descrever o limite esperado | Não é um controle de acesso |
| Aplicação de ferramenta | Rejeitar uma operação não autorizada | Deve verificar identidade, objeto e argumentos |
Indicadores de gestão
| Indicador | O que mede | Primeira ação |
|---|---|---|
| Ações proibidas | Casos que causam efeitos fora do escopo | Bloquear e investigar cada efeito |
| Recusas falsas | Tarefas legítimas impedidas | Revisar sem ampliar as permissões |
| Abrangência | Canais e ferramentas realmente testados | Declarar pontos cegos |
Erros comuns
- Colocar segredos em prompts de teste
- Testar apenas respostas visíveis
- Presumir que documentos internos são sempre confiáveis
- Afirmar proteção absoluta após alguns testes
Perguntas frequentes
O RAG impede a injeção de código?
Não. Os documentos recuperados podem conter instruções adversárias. As fontes permanecem como dados a serem processados dentro de limites controlados.
Todo documento suspeito deve ser bloqueado?
Depende da tarefa; um agente geralmente pode analisar um documento sem seguir suas instruções ou possuir ferramentas de escrita.
Como os resultados devem ser publicados?
Indique as versões, o escopo, os efeitos testados, as limitações e as correções. Exclua segredos e documentos do cliente usados no trabalho.
Referências oficiais
As referências apoiam o método. Adapte as verificações ao seu contexto; elas não são uma certificação. Os títulos das referências originais e os documentos de origem podem estar em outro idioma.






