Recursos · 44

Inyección de instrucciones (prompt injection): probar los límites de confianza de un agente de IA

Comprobar que un documento, resultado de búsqueda o mensaje no puede autorizar una acción por parte del usuario.

Actualizado · 3 min

Lo que esta guía ayuda a lograr

  • Separar datos de instrucciones
  • Limitar acciones disponibles a la tarea
  • Probar efectos reales detrás de las respuestas
  • Limitaciones y regresiones del documento

Comprobación rápida

  • ¿Qué contenido externo lee el agente?
  • ¿Qué acciones puede desencadenar sin aprobación?
  • ¿Se aplica la autorización fuera del modelo?
  • ¿Una negativa verbal realmente impide una llamada a la herramienta?
  • ¿Cómo frenar un escenario divergente?

Método paso a paso

  1. 1

    Inventario de los límites

    Listar mensajes, páginas web, documentos, resultados de búsqueda, archivos adjuntos y salidas de herramientas. Trátelos como datos para interpretar sin autoridad sobre permisos. Incluya canales que transmitan texto o contenido multimodal.

    Entregable: mapa de insumos y acciones disponibles.

  2. 2

    Definir efectos prohibidos

    Describir daños a prevenir: acceso fuera de alcance, publicación no aprobada, transferencia de datos o cambios de cuenta. Establecer un resultado observable para cada escenario; juzgar sólo el texto de la respuesta puede pasar por alto una acción ya realizada.

    Entregable: escenarios de amenazas e invariantes.

  3. 3

    Aislar el entorno de prueba

    Utilice cuentas, documentos y destinos ficticios claramente etiquetados con marcadores de prueba y herramientas simuladas. Deshabilitar el envío real y el acceso a producción. Conserve las versiones del modelo, la configuración, el corpus y el conector para reproducir casos.

    Entregable: entorno versionado y conjunto de pruebas.

  4. 4

    Reproducir entradas adversarias

    Colocar en una fuente de prueba una instrucción que contradiga la tarea, solicite una acción fuera de alcance o afirme una autoridad falsa. Varíe el idioma, la ubicación, el formato y las combinaciones de fuentes. Medir la invocación de la herramienta, los argumentos y el efecto real.

    Entregable: rastros de casos exitosos, bloqueados y no resueltos.

  5. 5

    Fortalecer los controles externos

    Aplicar permisos mínimos, validación de argumentos, separación de lectura/escritura y destinos permitidos en las herramientas. Requerir aprobación contextual para operaciones sensibles. El RAG y una instrucción de rechazo por sí solos no eliminan el riesgo de inyección.

    Entregable: reglas ejecutables y pruebas de bypass.

  6. 6

    Seguimiento de cambios

    Reproducir casos tras cambios de modelo, corpus, herramientas o reglas. También realice un seguimiento de las tareas legítimas que se bloquean. Publicar el alcance probado y las limitaciones conocidas; El éxito en un conjunto de pruebas pequeño no establece la ausencia de vulnerabilidades.

    Entregable: informe de regresión y decisión de despliegue.

Ejemplo trabajado ficticio

Situación ilustrativa

Situación ilustrativa: un asistente resume un documento de prueba que solicita el envío de información a un destino externo.

Decisión y pruebas esperadas

La herramienta rechaza ese destino independientemente del texto generado. La prueba comprueba que no se envió nada y que el resumen legítimo sigue funcionando.

Distinguir los mecanismos

MecanismoPropósitoVerificación o limitación
Filtro de entradaDetectar algunos patrones sospechososPuede que falte nueva redacción
Instrucción del modeloDescribir el límite esperadoNo es un control de acceso
Aplicación de herramientasRechazar una operación no autorizadaDebe comprobar identidad, objeto y argumentos

Indicadores de gestión

IndicadorQué midePrimera acción
Acciones prohibidasCasos que causan efectos fuera de alcanceBloquea e investiga cada efecto
Falsas negativasTareas legítimas impedidasRevisar sin ampliar permisos
CoberturaCanales y herramientas realmente testadosDeclarar puntos ciegos

Errores comunes

  • Poner secretos en mensajes de prueba
  • Probando solo respuestas visibles
  • Asumiendo que los documentos internos siempre son de confianza
  • Reivindicando protección absoluta tras unas cuantas pruebas

Preguntas frecuentes

¿RAG previene la inyección?

No. Los documentos recuperados pueden contener por sí mismos instrucciones contradictorias. Las fuentes siguen siendo datos para procesar dentro de límites controlados.

¿Se debe bloquear todo documento sospechoso?

Depende de la tarea; un agente a menudo puede analizar un documento sin seguir sus instrucciones o sin tener herramientas de escritura.

¿Cómo se deben publicar los resultados?

Versiones de estado, alcance, efectos probados, limitaciones y correcciones. Excluir secretos y documentos de clientes utilizados en el trabajo.

Referencias oficiales

Las referencias respaldan el método. Adapte los controles a su contexto; no constituyen certificación. Los títulos de referencia originales y los documentos fuente pueden estar en otro idioma.