פריצת מודל (Jailbreak)

מודלים ושפה

מודלי AI מאומנים לסרב לבקשות מסוימות (הוראות מסוכנות, תוכן פוגעני). פריצת-מודל מנסה לעקוף את ההגבלה הזו — למשל בבקשה שהמודל "יעמיד פנים" שאין לו הגבלות, או ינסח את הבקשה בעקיפין.

זהו "משחק-חתול-ועכבר" מתמשך: כל שיטת-פריצה שמתגלה מובילה לאימון-בטיחות נוסף שסוגר אותה, ומעודדת ניסיונות פריצה יצירתיים חדשים — ולכן חברות AI רבות מפעילות תוכניות בדיקות-פריצה יזומות באופן שוטף.