בעידן שבו מודלי ראייה-שפה מציגים יכולות תפיסה מרשימות, אך קשה להסביר את תהליך החשיבה שלהם והם נוטים להזיות בשאלות מורכבות, חוקרים מציגים את MATA – Multi-Agent hierarchical Trainable Automaton. זו מערכת רב-סוכנים המוצגת כאוטומטון מדינות סופיות היררכי לחשיבה חזותית. הסוכן העליון, היפר-סוכן לימודי, בוחר את המעברים ברמת הגג. כל סוכן מייצג מצב באוטומטון ומפעיל אוטומטון תת-רמת קטן מבוסס כללים לשליטה מדויקת. כל הסוכנים קוראים וכותבים לזיכרון משותף, המספק היסטוריית ביצוע שקופה.
MATA פותרת בעיות של שיטות קומפוזיציונליות מסורתיות, שמסתמכות על סוכן יחיד או צינורות ידניים, ללא יכולת להחליט מתי לשתף פעולה בין סוכנים משלימים או להתחרות בין חופפים. ההיפר-סוכן, מבוסס LLM משורת, מבין את השאלה ואת יכולות הסוכנים, ובוחר את הסוכן האופטימלי לפתרון המשימה. כדי לאמן את מדיניות המעבר של ההיפר-סוכן, החוקרים בנו עצי מסלולי מעבר והפכו אותם לזוגות זיכרון-למצב הבא, ויצרו את מאגר הנתונים MATA-SFT-90K לאימון עדין מפוקח (SFT).
בניסויים על סטנדרטים מרובים של חשיבה חזותית, MATA משיגה תוצאות חלוציות בהשוואה לבסיסי monolithic וקומפוזיציונליים. המערכת זמינה בקוד ובנתונים באתר GitHub של ControlNet. שקיפות הביצוע, הודות לזיכרון המשותף, מאפשרת הבנה טובה יותר של תהליכי ה-AI, מה שחיוני ליישומים עסקיים.
לעומת מודלים מונוליטיים שמסתירים את הלוגיקה הפנימית, MATA מציעה גישה מודולרית ומבוקרת, המתאימה לעולם העסקי שבו אמון ושקיפות הם מפתח. בישראל, שבה חברות כמו Mobileye מובילות בראייה ממוחשבת, טכנולוגיה כזו יכולה לשפר פיתוח מערכות אוטונומיות ומעקב חכם.
עבור מנהלי טכנולוגיה, MATA מדגישה את הצורך במערכות רב-סוכנים גמישות. כדאי לבדוק את הקוד ולשקול אינטגרציה בפרויקטי AI חזותי. מה תהיה ההשפעה על כלי הניתוח העסקי שלכם?