DPO (אופטימיזציית העדפה ישירה)
מודלים ושפה
בעוד ש-RLHF דורש שני שלבי-אימון נפרדים (מודל-תגמול, ואז למידת-חיזוק), DPO משתמשת ישירות בזוגות "תשובה מועדפת / תשובה פחות-מועדפת" כדי לכוונן את המודל, בנוסחה מתמטית פשוטה יותר.
היתרון המרכזי: פחות שלבי-אימון, יציבות רבה יותר, ועלות-חישוב נמוכה יותר — מה שהפך אותה לפופולרית בקרב חברות וקהילות קוד-פתוח שאין להן משאבי-חישוב של החברות הגדולות ביותר.