בעידן שבו מודלים גדולים של שפה (LLMs) מתמודדים עם משימות מורכבות באמצעות חיפוש מידע איטרטיבי, נתקלים מפתחי AI ב'דילמת ההומוגניזציה הכפולה'. הדילמה הזו פוגעת בשיטות הלמידה המחוזקת (RL) הנוכחיות, שמסתמכות על תגמולים דלילים ברמת התוצאה הסופית. לפי המחקר החדש, הדילמה מתבטאת בשני חלקים: הומוגניזציה של התהליך, שמתעלמת מחשיבה, ניתוח והפעלת כלים; והומוגניזציה בתוך-קבוצה, שגורמת לבעיות בהערכת יתרון בתוך דגימות עם שיטות כמו GRPO. (72 מילים)
כדי להתגבר על הבעיה, מציגים החוקרים את TSPO – אופטימיזציית מדיניות ברמת-סיבוב מודעת שלבים. TSPO משלב מנגנון First-Occurrence Latent Reward (FOLR), שמקצה חלק מהתגמול לסיבוב הראשון שבו מופיע התשובה הנכונה. כך נשמרים אותות ברמת התהליך, מגדל וריאנס התגמולים בתוך קבוצות, ללא צורך במודלי תגמול חיצוניים או הערות ידניות. השיטה מאפשרת ל-LLMs לפתור משימות מורכבות בצורה יעילה יותר דרך חשיבה רב-סיבובית משולבת כלים. (92 מילים)
בניסויים מקיפים, TSPO עלתה על שיטות הסטנדרט ברמה גבוהה. על מודל Qwen2.5-3B השיגה שיפור ממוצע של 24%, ועל Qwen2.5-7B – 13.6%. התוצאות מראות עלייה משמעותית בביצועים במשימות חיפוש מוגבר, תוך שמירה על יעילות למידה. החוקרים מדגישים כי TSPO פותרת את חולשות ה-RL המסורתי בשילוב חיפוש, ומאפשרת אופטימיזציה מדויקת יותר של מדיניות החיפוש הרב-סיבובי. (85 מילים)
המשמעות של TSPO עולה בקנה אחד עם המגמה הגוברת של שילוב כלים חיצוניים ב-LLMs, כמו מנועי חיפוש או מסדי נתונים. בעוד שיטות קודמות התמקדו בתגמולים סופיים גסים, TSPO מביאה דיוק ברמת הסיבובים, מה שמפחית בזבוז משאבים באימון. עבור עסקים ישראליים המפתחים AI, זה אומר פוטנציאל לשיפור מהיר בביצועי סוכנים אוטונומיים מבוססי LLM. השיטה זמינה כעת ב-arXiv ומזמינה בדיקות נוספות. (88 מילים)
לסיכום, TSPO מציעה דרך חדשנית להתמודד עם אתגרי הלמידה המחוזקת בחשיבה משולבת כלים, עם שיפורים מוכחים במודלים קטנים יחסית. מנהלי טכנולוגיה צריכים לשקול אינטגרציה של TSPO בפרויקטי AI כדי להאיץ פיתוח סוכנים חכמים. מה תהיה ההשפעה על מודלי השפה הבאים? (68 מילים)