참고 자료 · 44

프롬프트 주입: AI 에이전트의 신뢰 경계 테스트

문서, 검색 결과 또는 메시지가 사용자를 대신하여 작업을 승인할 수 없는지 확인합니다.

업데이트됨 · 3 min

이 가이드가 달성하는 목표

  • 데이터와 지침 분리.
  • 작업에 사용할 수 있는 작업 제한.
  • 응답 뒤에 숨겨진 실제 효과 테스트.
  • 제한 사항 및 회귀 문서화.

빠른 확인

  • 에이전트가 읽는 외부 콘텐츠는 무엇인가?
  • 승인 없이 실행할 수 있는 작업은 무엇인가?
  • 모델 외부에서 권한 부여가 시행되는가?
  • 구두 거부가 실제로 도구 호출을 방지하는가?
  • 발산 시나리오를 어떻게 중지할 수 있는가?

단계별 방법

  1. 1

    경계 목록 작성

    메시지, 웹 페이지, 문서, 검색 결과, 첨부 파일 및 도구 출력 목록을 작성합니다. 권한에 대한 통제 없이 해석할 수 있는 데이터로 취급합니다. 텍스트 또는 멀티모달 콘텐츠를 전달하는 채널을 포함합니다.

    결과물: 입력 및 사용 가능한 작업 지도

  2. 2

    금지된 효과 정의

    방지해야 할 피해 유형 설명: 범위 외 접근, 승인되지 않은 게시, 데이터 전송 또는 계정 변경. 각 시나리오에 대한 관찰 가능한 결과를 설정합니다. 응답 텍스트만 판단하면 이미 수행된 작업을 놓칠 수 있습니다.

    결과물: 위협 시나리오 및 불변 요소

  3. 3

    테스트 환경 격리

    테스트 마커와 시뮬레이션 도구를 사용하여 명확하게 레이블이 지정된 가상의 계정, 문서 및 대상을 사용합니다. 실제 전송 및 프로덕션 접근을 비활성화합니다. 사례 재현을 위해 모델, 구성, 코퍼스 및 커넥터 버전을 보관합니다.

    결과물: 버전 관리된 환경 및 테스트 세트

  4. 4

    공격적 입력 재현

    테스트 소스에 작업과 모순되거나, 범위를 벗어난 작업을 요청하거나, 허위 권한을 주장하는 명령어를 삽입합니다. 언어, 위치, 형식 및 소스 조합을 다양하게 변경합니다. 도구 호출, 인수 및 실제 효과를 측정합니다.

    결과물: 성공, 차단 및 미해결 사례 추적

  5. 5

    외부 제어 강화

    도구에서 최소 권한, 인수 유효성 검사, 읽기/쓰기 분리 및 허용 대상을 적용합니다. 민감한 작업에 대해서는 상황별 승인을 요구합니다. RAG(Referral Assessment Group) 및 거부 명령만으로는 인젝션 위험을 제거할 수 없습니다.

    결과물: 실행 가능한 규칙 및 우회 테스트

  6. 6

    변경 사항 추적

    모델, 코퍼스, 도구 또는 규칙 변경 후 사례를 재현합니다. 차단된 정상적인 작업도 추적합니다. 테스트 범위와 알려진 제한 사항을 공개합니다. 소규모 테스트 세트에서의 성공은 취약점이 없음을 입증하는 것은 아닙니다.

    결과물: 회귀 분석 보고서 및 배포 결정.

가상 예시

예시 상황

예시 상황: 어시스턴트가 외부 대상으로 정보를 전송하도록 요청하는 테스트 문서를 요약합니다.

결정 및 예상 증거

도구는 생성된 텍스트와 관계없이 해당 대상을 거부합니다. 테스트는 아무것도 전송되지 않았으며 정상적인 요약이 여전히 작동하는지 확인합니다.

메커니즘 구분

메커니즘목적검증 또는 제한
입력 필터의심스러운 패턴 감지새로운 표현을 놓칠 수 있음
모델 지침예상 경계 설명접근 제어가 아님
도구 강제 적용승인되지 않은 작업 거부신원, 객체 및 인수 확인 필수

관리 지표

지표측정 대상첫 번째 조치
금지된 작업범위 외 효과를 유발하는 경우모든 효과를 차단하고 조사
허위 거부합법적인 작업 방지권한 확대 없이 수정
범위실제로 테스트된 채널 및 도구사각지대 선언

일반적인 실수

  • 테스트 프롬프트에 비밀 정보 포함
  • 보이는 답변만 테스트
  • 내부 문서는 항상 신뢰할 수 있다고 가정
  • 몇 번의 테스트 후 절대적인 보호 주장

자주 묻는 질문

수행함 RAG는 ​​주입 공격을 방지할 수 있습니까?

아니요. 검색된 문서 자체에 악의적인 지침이 포함될 수 있습니다. 소스는 통제된 경계 내에서 처리해야 할 데이터로 유지됩니다.

모든 의심스러운 문서를 차단해야 합니까?

작업에 따라 다릅니다. 에이전트는 지침을 따르거나 쓰기 도구가 없더라도 문서를 분석할 수 있는 경우가 많습니다.

결과는 어떻게 게시해야 합니까?

버전, 범위, 테스트된 효과, 제한 사항 및 수정 사항을 명시하십시오. 작업에 사용된 기밀 정보 및 클라이언트 문서는 제외하십시오.

공식 참조

참조는 방법을 뒷받침합니다. 상황에 맞게 검사를 조정하십시오. 이는 인증이 아닙니다. 원본 참조 제목 및 소스 문서는 다른 언어로 작성되었을 수 있습니다.