יישור (Alignment)

בטיחות ואתיקה

יישור (Alignment) הוא התחום שעוסק בלוודא שמודל AI פועל בפועל בהתאם לכוונות וערכים אנושיים רצויים — לא רק "עונה נכון" מבחינה טכנית-סטטיסטית.

הבעיה המרכזית: מודל AI מאומן לבצע היטב את מה שהוא נמדד עליו, אבל המדד עצמו עלול לפספס את מה שאנחנו באמת רוצים — פער בין "מה שנמדד" ל"מה שרצוי באמת".

טכניקות יישור נפוצות כוללות למידת חיזוק מפידבק אנושי ו"הקשחה" של המודל דרך פרומפט מערכת קפדני. יישור-יתר (מודל זהיר ומתחמק מדי) נחשב לבעיה בפני עצמה, לא פחות ממודל חופשי-מדי.