בעידן שבו מודלי בינה מלאכותית משפרים יכולות היגיון באמצעות הרחבת זמן החישוב בזמן מבחן, עדיין קיימת בעיה מרכזית: שרשרת מחשבה ארוכה (Long-CoT) עלולה להוביל להתחייבות מוקדמת לשגיאה, שבה המודל ממשיך לפתח הסבר עצמי-עקבי אך שגוי. חוקרים זיהו 'מלכודות חשיבה' – מצבים של התקעות בשלבי הפרפיקס המוקדמים, שבהם ניסיונות מאוחרים יותר לתיקון, חשיבה חלופית או אימות נכשלים לתקן את השורש. במחקר זה, שפורסם ב-arXiv, הם מנתחים מסלולים מפורטים ומגלים שבתת-קבוצה ממורקת של DAPO-MATH, 89% מכשלונות מציגים מלכודות כאלה. הפתרון? TAAR – Trap-Aware Adaptive Restart.
המדענים פיתחו מסגרת בקרה בזמן מבחן בשם TAAR, שמאמנת מדיניות אבחון לחזות שני אותות ממסלולים חלקיים: מדד מלכודת שמציין איפה לקטוע, והסתברות בריחה שקובעת את עוצמת ההתערבות. בזמן אינפרנס, TAAR קוטע את המסלול לפני קטע המלכודת החזוי ומאתחל מחדש את הפענוח באופן מותאם. במקרים חמורים, הוא מפעיל הפרעות חזקות יותר כמו דגימה בטמפרטורה גבוהה יותר או סיומת אתחול מובנית. הגישה אינה דורשת אימון מחדש של פרמטרי המודל הבסיסי, מה שהופך אותה לפרקטית ליישום מיידי.
בניסויים על בנצ'מרקים מאתגרים של היגיון מתמטי ומדעי כמו AIME24, AIME25, GPQA-Diamond, HMMT25 ו-BRUMO25, TAAR משפר משמעותית את ביצועי ההיגיון. לפי הדיווח, השיטה מצליחה להתגבר על מלכודות חשיבה על ידי זיהוי מוקדם ואתחול חכם, ומאפשרת למודלים להגיע לפתרונות נכונים יותר ללא שינוי במודל עצמו. זהו צעד חשוב בהבנת מגבלות שרשרת מחשבה ארוכה.
משמעות המחקר גדולה לעולם ה-AI: מנהלי עסקים ישראלים בתחום הטכנולוגיה יכולים ליישם כלים כאלה כדי לשפר דיוק במודלים המשמשים לניתוח נתונים מורכבים, תחזיות פיננסיות או פיתוח תוכנה אוטומטי. בהשוואה לשיטות קודמות, TAAR מתמקד בדיוק בבעיית הפרפיקס, מה שמבדיל אותו ומעלה את היעילות. בישראל, שבה חברות כמו Mobileye ו-Wiz משקיעות רבות ב-AI, גילויים כאלה יכולים להאיץ חדשנות.
לסיכום, מלכודות חשיבה חושפות חולשה מרכזית ב-Long-CoT, אך TAAR מציע פתרון מעשי. מנהלים צריכים לשקול אינטגרציה של מנגנוני אבחון כאלה בפלטפורמות AI. מה תהיה ההשפעה על כלים עסקיים? קראו את המחקר המלא ב-arXiv.