מעקות בטיחות (Guardrails)

בטיחות ואתיקה

מעקות בטיחות (Guardrails) הם כללים והגבלות שמוטמעים במודל AI — בדרך כלל דרך פרומפט מערכת ואימון ייעודי — כדי למנוע ממנו לספק תוכן מזיק, מסוכן, או בלתי הולם.

מעקות בטיחות טיפוסיים כוללים סירוב לספק הוראות ליצירת נשק או חומרים מסוכנים, הימנעות ממתן ייעוץ רפואי או משפטי מוסמך, וחסימת תוכן פוגעני. הן פועלות בכמה שכבות: באימון המודל עצמו, ובבדיקות נוספות שרצות על הקלט והפלט בזמן אמת.

איזון מעקות הבטיחות הוא אתגר עדין: מעקות רופפים מדי מסכנים משתמשים; מעקות קשוחים מדי הופכים את המודל למתחמק ופחות שימושי גם בבקשות לגיטימיות לחלוטין — בדיוק המתח שנתקלים בו בפיתוח כל מוצר AI רציני.