מחקר9 בדצמבר 20252 דקות·מ־arXiv cs.AIDaGRPO: שיטה חדשה משפרת חשיבה ארוכת טווח במודלי שפהמודלי שפה גדולים מתקשים בחשיבה ארוכת טווח? DaGRPO פותרת בעיות יציבות ב-GRPO עם תיקון גרדיאנט והגברת נתונים, ומשיגה שיאים במבחנים. קראו על הפריצה החדשה.DaGRPOGRPOקרא עוד