Ресурсы · 44

Внедрение подсказок: проверка границ доверия ИИ-агента

Проверка того, что документ, результат поиска или сообщение не могут авторизовать действие от имени пользователя.

Обновлено · 3 min

Чего помогает достичь это руководство

  • Разделение данных и инструкций.
  • Ограничение доступных действий задачей.
  • Тестирование реальных эффектов, стоящих за ответами.
  • Документирование ограничений и регрессий.

Быстрая проверка

  • Какой внешний контент читает агент?
  • Какие действия он может запускать без одобрения?
  • Обеспечивается ли авторизация вне модели?
  • Предотвращает ли устный отказ вызов инструмента?
  • Как можно остановить расходящийся сценарий?

Пошаговый метод

  1. 1

    Инвентаризация границ

    Перечислите сообщения, веб-страницы, документы, результаты поиска, вложения и выходные данные инструментов. Рассматривайте их как данные для интерпретации без контроля над правами доступа. Включите каналы, передающие текстовый или мультимодальный контент.

    Результат: карта входных данных и доступных действий.

  2. 2

    Определение запрещенных эффектов

    Опишите вред, чтобы предотвратить: доступ за пределы области действия, несанкционированную публикацию, передачу данных или изменение учетной записи. Установите наблюдаемый результат для каждого сценария; оценка только текста ответа может упустить уже выполненное действие.

    Результат: сценарии угроз и инварианты.

  3. 3

    Изолируйте тестовую среду

    Используйте четко обозначенные фиктивные учетные записи, документы и адреса назначения с тестовыми маркерами и имитированными инструментами. Отключите реальный доступ для отправки и доступа к производственной среде. Сохраняйте версии модели, конфигурации, корпуса и коннектора для воспроизведения сценариев.

    Результат: версионированная среда и набор тестов.

  4. 4

    Воспроизведение враждебных входных данных

    Вставьте в исходный код теста инструкцию, которая противоречит задаче, запрашивает действие, выходящее за рамки области действия, или утверждает ложные полномочия. Варьируйте язык, размещение, формат и комбинации исходных данных. Измеряйте вызов инструмента, аргументы и фактический эффект.

    Результат: трассировки успешных, заблокированных и неразрешенных случаев.

  5. 5

    Усиление внешнего контроля

    Обеспечение минимальных разрешений, проверки аргументов, разделения чтения/записи и разрешенных адресов назначения в инструментах. Требование контекстного подтверждения для конфиденциальных операций. RAG и инструкция отказа сами по себе не устраняют риск внедрения.

    Результат: исполняемые правила и обходные тесты.

  6. 6

    Отслеживание изменений

    Воспроизведение случаев после изменений в модели, корпусе, инструментах или правилах. Также отслеживайте легитимные задачи, которые блокируются. Публикуйте область тестирования и известные ограничения; успех на небольшом тестовом наборе не подтверждает отсутствие уязвимостей. Результат проекта

    Результат: отчет о регрессионном тестировании и решение о развертывании.

Вымышленный пример

Иллюстративная ситуация

Иллюстративная ситуация: помощник составляет краткое изложение тестового документа, который запрашивает отправку информации во внешний пункт назначения.

Решение и ожидаемые доказательства

Инструмент отклоняет этот пункт назначения независимо от сгенерированного текста. Тест проверяет, что ничего не было отправлено, и легитимное краткое изложение по-прежнему работает.

Различение механизмов

МеханизмНазначениеПроверка или ограничение
Фильтр вводаВыявление подозрительных шаблоновВозможно пропуск новой формулировки
Моделирование инструкцииОписание ожидаемой границыНе является контролем доступа
Применение инструментаОтклонение несанкционированной операцииНеобходимо проверить идентичность, объект и аргументы

Показатели управления

ПоказательЧто он измеряетПервое действие
Запрещенные действияСлучаи, вызывающие эффекты, выходящие за рамки области действияБлокировка и расследование каждого эффекта
Ложные отказыПредотвращение законных задачПересмотр без расширения разрешений
ОхватФактически протестированные каналы и инструментыОбъявление слепых зон

Распространенные ошибки

  • Внесение секретов в тестовые подсказки
  • Тестирование только видимых ответов
  • Предположение о том, что внутренним документам всегда доверяют
  • Заявление об абсолютной защите после нескольких тесты

Часто задаваемые вопросы

Предотвращает ли RAG внедрение?

Нет. Полученные документы сами по себе могут содержать враждебные инструкции. Источники остаются данными для обработки в контролируемых рамках.

Следует ли блокировать каждый подозрительный документ?

Это зависит от задачи; агент часто может анализировать документ, не следуя его инструкциям и не имея инструментов для написания кода.

Как следует публиковать результаты?

Укажите версии, область применения, проверенные эффекты, ограничения и исправления. Исключите секреты и клиентские документы, использованные в работе.

Официальные ссылки

Ссылки подтверждают метод. Адаптируйте проверки к вашему контексту; они не являются сертификацией. Оригинальные названия ссылок и исходные документы могут быть на другом языке.