Recursos · 44
Inyección de instrucciones (prompt injection): probar los límites de confianza de un agente de IA
Comprobar que un documento, resultado de búsqueda o mensaje no puede autorizar una acción por parte del usuario.
Actualizado · 3 min
Lo que esta guía ayuda a lograr
- Separar datos de instrucciones
- Limitar acciones disponibles a la tarea
- Probar efectos reales detrás de las respuestas
- Limitaciones y regresiones del documento
Comprobación rápida
- ¿Qué contenido externo lee el agente?
- ¿Qué acciones puede desencadenar sin aprobación?
- ¿Se aplica la autorización fuera del modelo?
- ¿Una negativa verbal realmente impide una llamada a la herramienta?
- ¿Cómo frenar un escenario divergente?
Método paso a paso
- 1
Inventario de los límites
Listar mensajes, páginas web, documentos, resultados de búsqueda, archivos adjuntos y salidas de herramientas. Trátelos como datos para interpretar sin autoridad sobre permisos. Incluya canales que transmitan texto o contenido multimodal.
Entregable: mapa de insumos y acciones disponibles.
- 2
Definir efectos prohibidos
Describir daños a prevenir: acceso fuera de alcance, publicación no aprobada, transferencia de datos o cambios de cuenta. Establecer un resultado observable para cada escenario; juzgar sólo el texto de la respuesta puede pasar por alto una acción ya realizada.
Entregable: escenarios de amenazas e invariantes.
- 3
Aislar el entorno de prueba
Utilice cuentas, documentos y destinos ficticios claramente etiquetados con marcadores de prueba y herramientas simuladas. Deshabilitar el envío real y el acceso a producción. Conserve las versiones del modelo, la configuración, el corpus y el conector para reproducir casos.
Entregable: entorno versionado y conjunto de pruebas.
- 4
Reproducir entradas adversarias
Colocar en una fuente de prueba una instrucción que contradiga la tarea, solicite una acción fuera de alcance o afirme una autoridad falsa. Varíe el idioma, la ubicación, el formato y las combinaciones de fuentes. Medir la invocación de la herramienta, los argumentos y el efecto real.
Entregable: rastros de casos exitosos, bloqueados y no resueltos.
- 5
Fortalecer los controles externos
Aplicar permisos mínimos, validación de argumentos, separación de lectura/escritura y destinos permitidos en las herramientas. Requerir aprobación contextual para operaciones sensibles. El RAG y una instrucción de rechazo por sí solos no eliminan el riesgo de inyección.
Entregable: reglas ejecutables y pruebas de bypass.
- 6
Seguimiento de cambios
Reproducir casos tras cambios de modelo, corpus, herramientas o reglas. También realice un seguimiento de las tareas legítimas que se bloquean. Publicar el alcance probado y las limitaciones conocidas; El éxito en un conjunto de pruebas pequeño no establece la ausencia de vulnerabilidades.
Entregable: informe de regresión y decisión de despliegue.
Ejemplo trabajado ficticio
Situación ilustrativa
Situación ilustrativa: un asistente resume un documento de prueba que solicita el envío de información a un destino externo.
Decisión y pruebas esperadas
La herramienta rechaza ese destino independientemente del texto generado. La prueba comprueba que no se envió nada y que el resumen legítimo sigue funcionando.
Distinguir los mecanismos
| Mecanismo | Propósito | Verificación o limitación |
|---|---|---|
| Filtro de entrada | Detectar algunos patrones sospechosos | Puede que falte nueva redacción |
| Instrucción del modelo | Describir el límite esperado | No es un control de acceso |
| Aplicación de herramientas | Rechazar una operación no autorizada | Debe comprobar identidad, objeto y argumentos |
Indicadores de gestión
| Indicador | Qué mide | Primera acción |
|---|---|---|
| Acciones prohibidas | Casos que causan efectos fuera de alcance | Bloquea e investiga cada efecto |
| Falsas negativas | Tareas legítimas impedidas | Revisar sin ampliar permisos |
| Cobertura | Canales y herramientas realmente testados | Declarar puntos ciegos |
Errores comunes
- Poner secretos en mensajes de prueba
- Probando solo respuestas visibles
- Asumiendo que los documentos internos siempre son de confianza
- Reivindicando protección absoluta tras unas cuantas pruebas
Preguntas frecuentes
¿RAG previene la inyección?
No. Los documentos recuperados pueden contener por sí mismos instrucciones contradictorias. Las fuentes siguen siendo datos para procesar dentro de límites controlados.
¿Se debe bloquear todo documento sospechoso?
Depende de la tarea; un agente a menudo puede analizar un documento sin seguir sus instrucciones o sin tener herramientas de escritura.
¿Cómo se deben publicar los resultados?
Versiones de estado, alcance, efectos probados, limitaciones y correcciones. Excluir secretos y documentos de clientes utilizados en el trabajo.
Referencias oficiales
Las referencias respaldan el método. Adapte los controles a su contexto; no constituyen certificación. Los títulos de referencia originales y los documentos fuente pueden estar en otro idioma.






