בעידן שבו מודלי שפה גדולים ומודלי שפה-ראייה נדרשים להפגין חשיבה לוגית מפורשת, למידה מחוזקת (RL) הופכת לכלי מבטיח. אולם, אימון פוסט-טריינינג ממוקד חשיבה נתקל באתגרים קשים: תגמולים נדירים ברמת המסלול, הקצאת זיכוי מעורפלת וכשלי חקירה שתוקעים את המדיניות במצב 'צוק למידה'. שיטות זיקוק על-פוליסי אחרונות מציעות פיקוח צפוף ממורה יציב, אך הן מיישמות אותו באופן אחיד על כל המסלולים המיוצרים. מאמר חדש מציג את KEPO – Knowledge-Enhanced Preference Optimization – מסגרת מאוחדת שמשלבת זיקוק על-פוליסי מסונן איכות וחקירה מוגברת בידע.
KEPO פותרת את הבעיה על ידי יישום סלקטיבי של הדרכת מורה צפופה רק על מסלולים איכותיים. מסלולים נמוכי איכות, שמקורם לעיתים קרובות בשגיאות לוגיות מוקדמות, אינם מקבלים זיקוק שמזרים גרדיאנטים רועשים ומנוגדים. במקביל, אסטרטגיית החקירה המוגברת בידע משתמשת ברמזים שנלמדו ממודל המורה לדגימה דחייתית של מסלולים חיוביים בתגמול, ובכך מונעת קריסת חקירה. השיטה מאפשרת אופטימיזציה יציבה יותר ומפחיתה את הסיכון להיתקעות במצבים בעייתיים.
במחקר שפורסם ב-arXiv, KEPO נבחנה על בנצ'מרק מאתגר של שאלות-תשובות חזותיות רפואיות תחת הכללה ממקור יחיד. התוצאות מראות שיפור משמעותי ביציבות האימון, התנהגויות חשיבה קוהרנטיות יותר וביצועים עליונים בהכללה מחוץ להפצה בהשוואה לבסיסי למידה מחוזקת וזיקוק על-פוליסי. החוקרים מדגישים כי הגישה המסוננת מונעת הזרקת רעש ומשפרת את איכות המסלולים.
המשמעות של KEPO גדולה במיוחד עבור תחומים הדורשים חשיבה מורכבת כמו רפואה, שבו שגיאות לוגיות מוקדמות עלולות להוביל למסקנות שגויות. בהשוואה לשיטות קודמות שמיישמות הדרכה אחידה, KEPO מציעה גישה ממוקדת שמתאימה למשימות חשיבה אינטנסיביות. בישראל, שבה מחקר AI רפואי פורח, השיטה עשויה לשפר מודלים מקומיים.
עבור מנהלי עסקים וחוקרים, KEPO מסמנת כיוון חדש באימון מודלי AI: שילוב ידע חיצוני בחקירה ושימוש סלקטיבי בהדרכה. כיצד זה ישפיע על היישומים העסקיים שלכם?