בעידן שבו סוכני AI נדרשים לפתור משימות מורכבות בעולמות רועשים ומגוונים, מציגים חוקרים את LongCat-Flash-Thinking-2601 – מודל תערובת מומחים (MoE) פתוח המבוסס על 560 מיליארד פרמטרים. המודל מציג ביצועים ברמה עולמית בקטגוריית המודלים הפתוחים במגוון רחב של בנצ'מרקים סוכניים, כולל חיפוש סוכני, שימוש בכלים וחשיבה המשלבת כלים. מעבר לביצועים אלה, הוא מדגים יכולת הכללה חזקה לאינטראקציות כלים מורכבות והתנהגות יציבה בסביבות רעש אמיתיות. ההישגים נובעים ממסגרת אימון מאוחדת המשלבת אימון מקבילי של מומחי דומיינים עם מיזוג מאוחר.
המודל משלב עיצוב מקצה לקצה של בניית נתונים, סביבות, אלגוריתמים ותשתיות – מכל שלבי האימון המוקדם ועד הפוסט-אימון. במיוחד, יכולת ההכללה בשימוש בכלים מורכבים נובעת מחקר מעמיק בהגדלת סביבות ובניית משימות עקרונית. כדי להתמודד עם יצירת טקסט ארוכה-זנב, אינטראקציות רב-תוריות ומשימות סוכניות, פותח מסגרת הלמידה חיזוקית אסינכרונית DORA מורחבת, המאפשרת אימון יציב על פני יותר מ-10,000 סביבות בלמעלה מ-20 דומיינים.
החוקרים זיהו כי משימות בעולם האמיתי מלאות רעש, ולכן ביצעו ניתוח שיטתי של דפוסי רעש אלה ועיצבו הליכי אימון ממוקדים לשילובם. תהליך זה משפר את העמידות ליישומים אמיתיים. בנוסף, מצב Heavy Thinking מאפשר הרחבת חשיבה בזמן מבחן על ידי הגברת עומק ורוחב חשיבה במקביל, מה שמטפל במשימות הנמקה מורכבות.
המודל מציע יתרון משמעותי לעסקים ישראליים בתחום ה-AI, שכן הוא פתוח ומאפשר התאמה מקומית. בהשוואה למודלים סגורים, LongCat-Flash-Thinking-2601 מפחית תלות בספקים חיצוניים ומאיץ פיתוח סוכנים ארגוניים. בישראל, שבה חברות כמו Mobileye ו-Wiz משקיעות בסוכני AI, הדגם יכול לשפר אוטומציה בתעשיות כמו סייבר ורכב אוטונומי.
עבור מנהלי טכנולוגיה, השקעה במודלים כמו זה פירושה יכולת תחרותית גבוהה יותר. עם זאת, יש לבחון את גודלו הגדול בהקשר תשתיות מקומיות. מה תהיה ההשפעה של מודלים פתוחים כאלה על שוק ה-AI הישראלי?