אמת-מידה (Benchmark)

מודלים ושפה

אמת-מידה (Benchmark) היא מבחן סטנדרטי ומוגדר מראש שמשווה בין מודלי AI שונים על אותה משימה בדיוק, כדי לדרג ביצועים באופן אובייקטיבי וניתן-להשוואה.

בנצ'מארקים נפוצים בודקים יכולות שונות — הבנת קריאה, פתרון בעיות מתמטיות, כתיבת קוד, ידע כללי — ומודלים מתחרים מדווחים את הציונים שלהם עליהם כדרך להוכיח יכולת.

בעיה ידועה: ברגע שבנצ'מארק הופך פופולרי מספיק, קיים סיכון של "אימון-לקראת-המבחן" — מודל שמצטיין בבנצ'מארק ספציפי לא בהכרח מתפקד טוב באותה מידה על משימות דומות שלא נכללו בו במפורש.