בעידן שבו בינה מלאכותית שולטת במשימות מתמטיות ותכנותיות, היא עדיין נופלת מאחור בבינה פיזית ומרחבית – תחומים שבהם בני אדם מצטיינים באמצעות דגמי עולם פנימיים. מחקר חדש מטיל אור על הפתרון: יצירת תמונות ויזואליות כחלק משרשרת מחשבה רב-מודלית. לפי המאמר, דגמי עולם רב-מודליים כאלה מאפשרים לבינה מלאכותית לחקות טוב יותר את תהליכי החשיבה האנושית, במיוחד במשימות שדורשות ייצוגים עשירים יותר מ言葉 בלבד.
בני אדם בונים דגמי עולם פנימיים ומסיקים מסקנות על ידי מניפולציה של מושגים בתוכם. התקדמות אחרונה בבינה מלאכותית, כמו שרשרת מחשבה (CoT), מקרבת יכולות אלה, כאשר דגמי עולם מוטמעים במודלים גדולים של שפה. מערכות נוכחיות משיגות ביצועים ברמה מומחה בתחומים פורמליים כמו מתמטיקה ותכנות בעיקר דרך היגיון מילולי. אולם, הן מפגרות מאחור בבינה פיזית ומרחבית, שדורשת ייצוגים עשירים יותר וידע מוקדם. הופעת מודלים רב-מודליים מאוחדים (UMMs), שמסוגלים לייצר גם טקסט וגם תמונות, מעוררת עניין בהיגיון דמוי אנוש המבוסס על מסלולים משלימים.
המאמר מציג את השערת העליונות הוויזואלית: במשימות מסוימות, במיוחד אלה המבוססות על העולם הפיזי, יצירת תמונות משמשת באופן טבעי יותר כדגמי עולם, בעוד דגמי עולם מילוליים בלבד נתקלים במגבלות ייצוגיות או חוסר בידע מוקדם. מבחינה תיאורטית, המחקר מפורמל את מודלינג העולם הפנימי כרכיב מרכזי בשרשרת מחשבה, ומבחין בין סוגי דגמי עולם שונים. זו הבדיקה המעשית הראשונה של מתי וכיצד יצירת תמונות תורמת להיגיון.
בניסויים מבוקרים על מודל רב-מודלי מתקדם, שרשרת מחשבה משולבת ויזואלית-מילולית עלתה באופן משמעותי על שרשרת מילולית טהורה במשימות שמעדיפות מודלינג ויזואלי. המחקר בנה סוויטת הערכה חדשה בשם VisWorld-Eval, שמזהה משימות הדורשות שילוב ויזואלי-מילולי. לעומת זאת, בשאר המשימות לא נמצאה יתרון ברור. התוצאות מבהירות את הפוטנציאל של דגמי עולם רב-מודליים להיגיון חזק יותר.
למנהלי עסקים ישראלים בתחום הטכנולוגיה, המחקר מצביע על כיוון חדש: שילוב יכולות ויזואליות במודלי AI יכול לשפר יישומים כמו רובוטיקה, ניווט אוטונומי וניתוח תמונות. כיצד זה ישפיע על התחרותיות העסקית? ההשקעה בטכנולוגיות רב-מודליות עשויה להיות המפתח לבינה מלאכותית דמוית אנוש, שתשנה את כללי המשחק בשווקים גלובליים.