בעידן שבו מודלי שפה-חזון (VLMs) מתמודדים עם בעיות מורכבות המשלבות טקסט ותמונות, שרשרת המחשבה (CoT) הקלאסית נתקלת בקושי. היא מתבססת על טקסט בלבד, בעוד שבמקרים ויזואליים אינטנסיביים, השלבים הביניים חייבים להיות ויזואליים. חוקרים מציגים כעת את 'שרשרת מחשבה מעורבת מודלית' (modal-mixed CoT), שמשלבת טוקנים טקסטואליים עם סקיצות ויזואליות קומפקטיות המיוצגות כמבני לייטנט (latent embeddings). השיטה מבטיחה התאמה סמנטית בין המודלים על ידי שימוש ב-VLM עצמו כמקודד, ואימון גב השפה לשחזור המבנים הוויזואליים הביניים.
השיטה פורצת את הפער המודלי מבלי לפגוע בידע הקיים של ה-VLM. היא מחברת מקודד לייטנט מבוסס דיפוזיה, שמופעל על ידי טוקן בקרה מיוחד ומתנהל ממצבי התייחסות נסתרים של ה-VLM. כך, ראש הדיפוזיה אחראי לפרטים תפיסתיים עדינים, בעוד ה-VLM קובע את הכוונה ברמה גבוהה. זה מפריד תפקידים ומקל על האופטימיזציה. האימון מתבצע בשני שלבים: כוונון עדין מפוקח על עקבות המשלבות טקסט ומבני לייטנט עם יעד משותף של טוקן הבא ושחזור לייטנט, ולאחר מכן למידת חיזוק שמלמדת מתי לעבור מודלים וכיצד לבנות שרשראות ארוכות.
ניסויים נרחבים ב-11 משימות רב-מודליות מגוונות הוכיחו עליונות על שיטות CoT טקסטואליות בלבד ועל שיטות אחרות. לפי הדיווח, השיטה משפרת את הביצועים בכמה מהמשימות המורכבות ביותר, ומאפשרת למודלים לטפל בשלבים ביניים ויזואליים באופן טבעי יותר. הקוד ישוחרר לציבור, מה שיאפשר למפתחים לבדוק ולשפר אותו.
השיטה מצביעה על מגמה עתידית בחשיבה רב-מודלית, שבה מודלים לא מוגבלים לטקסט בלבד. בהשוואה לשיטות קודמות, היא שומרת על יכולות ה-VLM הקיימות ומשפרת אותן ללא צורך באימון מחדש כולל. בישראל, שבה חברות כמו Mobileye ו-Wiz משקיעות רבות ב-AI רב-מודלי, השיטה יכולה להאיץ פיתוחים בתחומי רכב אוטונומי וניתוח תמונות.
עבור מנהלי עסקים, השיטה פותחת אפשרויות חדשות לאוטומציה של משימות מורכבות המשלבות חזון ושפה. כדאי לעקוב אחר שחרור הקוד ולשקול אינטגרציה במודלים פנימיים. מה תהיה ההשפעה על כלי AI הבאים?