Ресурсы · 44
Внедрение подсказок: проверка границ доверия ИИ-агента
Проверка того, что документ, результат поиска или сообщение не могут авторизовать действие от имени пользователя.
Обновлено · 3 min
Чего помогает достичь это руководство
- Разделение данных и инструкций.
- Ограничение доступных действий задачей.
- Тестирование реальных эффектов, стоящих за ответами.
- Документирование ограничений и регрессий.
Быстрая проверка
- Какой внешний контент читает агент?
- Какие действия он может запускать без одобрения?
- Обеспечивается ли авторизация вне модели?
- Предотвращает ли устный отказ вызов инструмента?
- Как можно остановить расходящийся сценарий?
Пошаговый метод
- 1
Инвентаризация границ
Перечислите сообщения, веб-страницы, документы, результаты поиска, вложения и выходные данные инструментов. Рассматривайте их как данные для интерпретации без контроля над правами доступа. Включите каналы, передающие текстовый или мультимодальный контент.
Результат: карта входных данных и доступных действий.
- 2
Определение запрещенных эффектов
Опишите вред, чтобы предотвратить: доступ за пределы области действия, несанкционированную публикацию, передачу данных или изменение учетной записи. Установите наблюдаемый результат для каждого сценария; оценка только текста ответа может упустить уже выполненное действие.
Результат: сценарии угроз и инварианты.
- 3
Изолируйте тестовую среду
Используйте четко обозначенные фиктивные учетные записи, документы и адреса назначения с тестовыми маркерами и имитированными инструментами. Отключите реальный доступ для отправки и доступа к производственной среде. Сохраняйте версии модели, конфигурации, корпуса и коннектора для воспроизведения сценариев.
Результат: версионированная среда и набор тестов.
- 4
Воспроизведение враждебных входных данных
Вставьте в исходный код теста инструкцию, которая противоречит задаче, запрашивает действие, выходящее за рамки области действия, или утверждает ложные полномочия. Варьируйте язык, размещение, формат и комбинации исходных данных. Измеряйте вызов инструмента, аргументы и фактический эффект.
Результат: трассировки успешных, заблокированных и неразрешенных случаев.
- 5
Усиление внешнего контроля
Обеспечение минимальных разрешений, проверки аргументов, разделения чтения/записи и разрешенных адресов назначения в инструментах. Требование контекстного подтверждения для конфиденциальных операций. RAG и инструкция отказа сами по себе не устраняют риск внедрения.
Результат: исполняемые правила и обходные тесты.
- 6
Отслеживание изменений
Воспроизведение случаев после изменений в модели, корпусе, инструментах или правилах. Также отслеживайте легитимные задачи, которые блокируются. Публикуйте область тестирования и известные ограничения; успех на небольшом тестовом наборе не подтверждает отсутствие уязвимостей. Результат проекта
Результат: отчет о регрессионном тестировании и решение о развертывании.
Вымышленный пример
Иллюстративная ситуация
Иллюстративная ситуация: помощник составляет краткое изложение тестового документа, который запрашивает отправку информации во внешний пункт назначения.
Решение и ожидаемые доказательства
Инструмент отклоняет этот пункт назначения независимо от сгенерированного текста. Тест проверяет, что ничего не было отправлено, и легитимное краткое изложение по-прежнему работает.
Различение механизмов
| Механизм | Назначение | Проверка или ограничение |
|---|---|---|
| Фильтр ввода | Выявление подозрительных шаблонов | Возможно пропуск новой формулировки |
| Моделирование инструкции | Описание ожидаемой границы | Не является контролем доступа |
| Применение инструмента | Отклонение несанкционированной операции | Необходимо проверить идентичность, объект и аргументы |
Показатели управления
| Показатель | Что он измеряет | Первое действие |
|---|---|---|
| Запрещенные действия | Случаи, вызывающие эффекты, выходящие за рамки области действия | Блокировка и расследование каждого эффекта |
| Ложные отказы | Предотвращение законных задач | Пересмотр без расширения разрешений |
| Охват | Фактически протестированные каналы и инструменты | Объявление слепых зон |
Распространенные ошибки
- Внесение секретов в тестовые подсказки
- Тестирование только видимых ответов
- Предположение о том, что внутренним документам всегда доверяют
- Заявление об абсолютной защите после нескольких тесты
Часто задаваемые вопросы
Предотвращает ли RAG внедрение?
Нет. Полученные документы сами по себе могут содержать враждебные инструкции. Источники остаются данными для обработки в контролируемых рамках.
Следует ли блокировать каждый подозрительный документ?
Это зависит от задачи; агент часто может анализировать документ, не следуя его инструкциям и не имея инструментов для написания кода.
Как следует публиковать результаты?
Укажите версии, область применения, проверенные эффекты, ограничения и исправления. Исключите секреты и клиентские документы, использованные в работе.
Официальные ссылки
Ссылки подтверждают метод. Адаптируйте проверки к вашему контексту; они не являются сертификацией. Оригинальные названия ссылок и исходные документы могут быть на другом языке.






