בעולם שבו דגמי שפה גדולים (LLMs) נכשלים במשימות חשיבה אינטראקטיביות, גישה חדשה מבוססת חקר גרפי מציגה פתרון פשוט אך יעיל. ARC-AGI-3 הוא אתגר חדשני הכולל משחקים שבהם סוכנים צריכים להסיק מנגנוני משימה דרך אינטראקציות מוגבלות, להתאים לרמות מורכבות גוברות. השיטה החדשה, ללא צורך באימון, משלבת עיבוד מסגרות ויזואליות עם חקר שיטתי של מרחב המצבים באמצעות ייצוגים מבוססי גרף. לפי הדיווח, היא פותרת מדיאנה של 30 מתוך 52 רמות בשישה משחקים ומדורגת במקום השלישי בלוח התוצאות הפרטי, הרבה מעבר ליכולות ה-LLMs המובילים.
ARC-AGI-3 חושף את מגבלות ה-LLMs הנוכחיים, שמתקשים לעקוב אחר דינמיקות משימה בסביבות עם משוב דליל. המשימות דורשות יצירת השערות, בדיקתן ומעקב אחר מנגנונים גילויים. השיטה החדשה מפלחת מסגרות ויזואליות לרכיבים משמעותיים, ממקדת פעולות על פי בולטות ויזואלית ומקיימת גרף מכוון של מצבים נחקרים ומעברים ביניהם. על ידי מעקב אחר מצבים שנבדקו ופעולות שנוסו, הסוכן ממקד פעולות שמספקות את הנתיב הקצר ביותר לזוגות מצב-פעולה לא נבדוקים.
הגישה מדגישה את החשיבות של חקר מבוסס גרף מובנה, גם ללא למידה, כבסיס חזק למשימות חשיבה אינטראקטיביות. היא עוקפת את הצורך במודלים כבדים ומספקת ביצועים גבוהים בסביבות מאתגרות. החוקרים מדווחים כי השיטה מצליחה היכן ש-LLMs נכשלים, ומדגישה את הצורך במעקב שיטתי אחר מצבים והעדפת פעולות.
למנהלי עסקים ישראלים בתחום הבינה המלאכותית, התוצאות הללו מצביעות על כיוונים חדשים בפיתוח סוכנים אוטונומיים. בעוד LLMs שולטים במשימות טקסטואליות, משימות אינטראקטיביות דורשות גישות מבוססות חוק ומבנה. השיטה הזו יכולה לשמש בסיס לשילובים היברידיים, במיוחד בתעשיות כמו רובוטיקה ואוטומציה.
הקוד זמין בקוד פתוח ב-GitHub, מה שמאפשר ניסויים מהירים. מה זה אומר לעתיד? האם חקר גרפי יחליף חלק מיכולות ה-LLMs? עכשיו הזמן לבדוק.