משאבים · 44

הזרקת הנחיות (Prompt injection): בדיקת גבולות האמון של סוכן בינה מלאכותית

בדיקה שמסמך, תוצאת חיפוש או הודעה אינם יכולים לאשר פעולה מטעם המשתמש.

מעודכן · 3 min

מה מדריך זה עוזר להשיג

  • הפרדת נתונים מהוראות.
  • הגבלת פעולות זמינות למשימה.
  • בדיקת השפעות אמיתיות מאחורי תגובות.
  • מגבלות ורגרסיות של מסמכים.

בדיקה מהירה

  • איזה תוכן חיצוני קורא הסוכן?
  • אילו פעולות הוא יכול להפעיל ללא אישור?
  • האם נאכפת הרשאה מחוץ למודל?
  • האם סירוב מילולי מונע בפועל קריאה לכלי?
  • כיצד ניתן לעצור תרחיש סוטה?

שיטה שלב אחר שלב

  1. 1

    רשימת מלאי של הגבולות.

    רשימת הודעות, דפי אינטרנט, מסמכים, תוצאות חיפוש, קבצים מצורפים ופלט של כלים. התייחסו אליהם כנתונים לפירוש ללא סמכות על הרשאות. כללו ערוצים הנושאים טקסט או תוכן רב-מודאלי.

    תוצר: מפת קלטים ופעולות זמינות.

  2. 2

    הגדרת השפעות אסורות.

    תיאור נזקים למניעה: גישה מחוץ לתחום, פרסום לא מאושר, העברת נתונים או שינויי חשבון. הגדרת תוצאה נצפית לכל תרחיש; שיפוט של טקסט התשובה בלבד יכול לפספס פעולה שכבר בוצעה.

    תוצר: תרחישי איום וקבועים.

  3. 3

    בידוד סביבת הבדיקה.

    שימוש בחשבונות, מסמכים ויעדים פיקטיביים המסומנים בבירור עם סמני בדיקה וכלים מדומים. השבתת גישת שליחה וייצור אמיתית. שמירה על גרסאות מודל, תצורה, קורפוס ומחבר כדי להפעיל מחדש מקרים.

    תוצר: סביבה עם גרסאות וערכת בדיקה.

  4. 4

    הפעלה מחדש של קלטים עוינים.

    הצבת הוראה במקור בדיקה שסותרת את המשימה, מבקשת פעולה מחוץ לתחום או טוענת לסמכות כוזבת. שינוי שפה, מיקום, פורמט ושילובי מקור. מדידת קריאה לכלי, ארגומנטים והשפעה בפועל.

    תוצר: עקבות של מקרים מוצלחים, חסומים ולא פתורים.

  5. 5

    חיזוק בקרות חיצוניות.

    אכיפת הרשאות מינימליות, אימות ארגומנטים, הפרדת קריאה/כתיבה ויעדים מותרים בכלים. דרישה לאישור הקשרי עבור פעולות רגישות. RAG והוראת סירוב בלבד אינם מסירים את סיכון ההזרקה.

    תוצר: כללים ניתנים לביצוע ובדיקות עקיפה.

  6. 6

    מעקב אחר שינויים.

    הפעלה חוזרת של מקרים לאחר שינויים במודל, בקורפוס, בכלים או בכללים. כמו כן מעקב אחר משימות לגיטימיות שנחסמות. פרסום היקף שנבדק ומגבלות ידועות; הצלחה על מערך בדיקות קטן אינה קובעת היעדרות של פגיעויות.

    תוצר: דוח רגרסיה והחלטת פריסה.

דוגמה בדיונית

סיטואציה להמחשה

סיטואציה לדוגמה: עוזר מסכם מסמך בדיקה המבקש לשלוח מידע ליעד חיצוני.

החלטה וראיות צפויות

הכלי דוחה יעד זה ללא קשר לטקסט שנוצר. הבדיקה בודקת ששום דבר לא נשלח והסיכום הלגיטימי עדיין פועל.

הבחנה בין המנגנונים

מנגנוןמטרהאימות או הגבלה
מסנן קלטזיהוי דפוסים חשודיםייתכן שחסר ניסוח חדש
הוראת מודלתיאור הגבול הצפויאינו בקרת גישה
אכיפת כליםדחיית פעולה לא מורשיתחובה לבדוק זהות, אובייקט וארגומנטים

מדדי ניהול

מדדמה הוא מודדפעולה ראשונה
פעולות אסורותמקרים הגורמים להשפעות מחוץ לתחוםחסימה וחקירה של כל השפעה
סירובים כוזביםמשימות לגיטימיות נמנעותיקון ללא הרחבת הרשאות
כיסויערוצים וכלים שנבדקו בפועלהכרזה על נקודות מתות

טעויות נפוצות

  • הכנסת סודות להנחיות בדיקה
  • בדיקת תשובות גלויות בלבד
  • בהנחה שמסמכים פנימיים תמיד מהימנים
  • טענת הגנה מוחלטת לאחר מספר בדיקות

שאלות נפוצות

האם RAG מונע הזרקה?

לא. מסמכים שאוחזרו יכולים בעצמם לשאת הוראות עוינות. מקורות נשארים נתונים לעיבוד בגבולות מבוקרים.

האם יש לחסום כל מסמך חשוד?

זה תלוי במשימה; סוכן יכול לעתים קרובות לנתח מסמך מבלי לפעול לפי הוראותיו או שיהיו לו כלי כתיבה.

כיצד יש לפרסם תוצאות?

ציין גרסאות, היקף, אפקטים שנבדקו, מגבלות ותיקונים. לא לכלול סודות ומסמכי לקוח ששימשו בעבודה.

הפניות רשמיות

הפניות תומכות בשיטה. התאימו את הבדיקות להקשר שלכם; הן אינן הסמכה. כותרות הפניות ומסמכי המקור המקוריים עשויים להיות בשפה אחרת.