בעולם המודלים של שפה גדולים, כוונון עדין בחיזוק דורש יצירת מסלול חשיבה מלא מהשאלה הראשונית, מה שגורם לעלות מחשוב עצומה בשלב ההרצה של האימון. חוקרים חדשים מציעים פתרון חכם: RPO – כוונון חיזוקי עם אופטימיזציית חשיבה חלקית. האלגוריתם הזה מפחית דרמטית את הצורך ביצירת מסלולים מלאים, ומבטיח חיסכון משמעותי בזמן ומשאבים עבור מפתחי AI.
RPO פועל על ידי ניתוח ההשפעה של חלקים שונים במסלול החשיבה על תקינות התוצאה הסופית. במקום לייצר מסלול מלא, האלגוריתם מייצר רק סופיות (suffixes) של המסלול באמצעות מטמון ניסיון. בשלב ההרצה של האימון, RPO מקטין את יצירת הטוקנים בכ-95%, מה שמוריד את העלות התיאורטית בזמן באופן ניכר. כך, הוא מאפשר אימון מהיר יותר מבלי לוותר על איכות.
בבדיקות, RPO קיצר את זמן האימון של מודל 1.5B ב-90% ושל מודל 7B ב-72%, בהשוואה לכוונון חיזוקי במסלול מלא. בנוסף, ניתן לשלב אותו בקלות עם אלגוריתמים מוכרים כמו GRPO ו-DAPO, תוך שמירה על ביצועים דומים לאלו של האלגוריתמים המקוריים. הקוד זמין בגיטהאב, מה שמקל על אימוץ מיידי בקהילת המפתחים.
המשמעות של RPO גדולה במיוחד עבור חברות טכנולוגיה שמתמודדות עם עלויות אימון גבוהות של מודלי AI. הוא מאפשר הדרכה יעילה יותר של מודלים גדולים, מה שמקרב את הטכנולוגיה לשימוש מסחרי רחב. בהקשר ישראלי, שבו סטארט-אפים רבים מפתחים פתרונות AI, חיסכון כזה יכול להיות משנה משחק, במיוחד עם שילוב באלגוריתמים קיימים.
עבור מנהלי עסקים ומפתחים, RPO מציע דרך להאיץ פיתוח מודלי שפה מבלי להשקיע במשאבי מחשוב כבדים. כדאי לבדוק את הקוד הפתוח ולשלבו בפרויקטים קיימים – השאלה היא, מתי תהפוך אופטימיזציה כזו לסטנדרט בתעשייה?