לפי סקירה מקיפה של MIT Technology Review במסגרת סדרת What's Next, תעשיית הבינה המלאכותית כולה נשענת כיום על טכנולוגיית הטרנספורמר (transformer) שהוצגה על ידי חוקרי גוגל (Google) בשנת 2017 במאמר המכונן "Attention Is All You Need". תשע שנים לאחר מכן, מנועי הטרנספורמר מניעים את כל מודלי השפה הגדולים (LLMs) המובילים בשוק. ג'סטין דנג'ל (Justin Dangel), מייסד שותף ומנכ"ל חברת הסטארטאפ Subquadratic, מציין כי מדובר באחת החדשנויות החשובות ביותר בהיסטוריה של מדעי המחשב, אשר שינתה את העולם באופן עמוק.
אולם הטרנספורמרים מתחילים להראות סימני התיישנות. התקדמויות אחרונות בתחום, כמו מודלי חשיבה והיכולת לטפל בקלט נתונים עצום בו-זמנית, אינן מהוות הרחבות טבעיות וחלקות של טכנולוגיית הליבה הזו, אלא שיטות עוקפות ומעקפים שנועדו לחפות על פגמים בסיסיים שלה. מדענים ומהנדסים רבים שואלים כעת מה צפוי להגיע בהמשך. בעוד מודלי ה-LLM עצמם אינם נעלמים, הדרך שבה הם נבנים פתוחה לחלוטין לשינויים. ב-MIT Technology Review כינו את הדור הבא של המודלים הללו בשם "LLMs+" ברשימת עשרת הדברים החשובים ביותר ב-AI לשנה זו. כעת, גל של חברות סטארטאפ חדשות מנסה לפרוץ את גבולות התחום, בידיעה שיש להן פחות מה להפסיד מאשר לחברות המובילות הנמצאות כיום בראש התעשייה.
צוואר הבקבוק ועלויות החישוב של הטרנספורמרים
כדי להבין את הצורך בשינוי, יש לבחון תחילה את הבעיה המרכזית בטרנספורמרים. עוצמתם מבוססת על מנגנון המכונה "קשב צפוף" (dense attention), המקודד משמעות של טקסט באמצעות השוואה של כל מילה (או חלק ממילה, המכונה טוקן) לכל מילה אחרת בטקסט בפעולות כפל רבות. מנגנון זה לוכד את משמעות הטקסט בדיוק רב, אך ככל שהטקסט מתארך, כמות החישובים גדלה במהירות: עיבוד מסמך באורך של 10,000 מילים דורש מטרנספורמר לבצע כ-50 מיליון פעולות כפל, וזהו הגורם המרכזי לצריכת האנרגיה העצומה של המודלים הללו.
העלויות הכרוכות בכך הן אדירות. נשיא OpenAI, גרג ברוקמן (Greg Brockman), מסר כי החברה צפויה להוציא כ-50 מיליארד דולר על משאבי מחשוב במהלך שנה זו בלבד. במקביל, סוכנות האנרגיה הבינלאומית (IEA) צופה כי כמות החשמל הכוללת שתיצרך על ידי מרכזי נתונים ברחבי העולם תוכפל עד שנת 2030.
יתרה מכך, מנגנוני הטרנספורמר מתקשים בביצוע המשימות שעבורן מתוכננים המודלים החדישים ביותר. בשל העיבוד של טקסט מילה אחר מילה, הם מתקשים בניהול מידע רב בו-זמנית, ולכן "חלון ההקשר" (context window) שלהם אינו יכול להיות גדול מדי. עם זאת, כדי שמודלי שפה גדולים יוכלו לבצע משימות מורכבות, הם נדרשים לקלוט כמויות מידע גדולות בהרבה: ספריות מסמכים, בסיסי קוד מלאים, או פלטים של מודלים אחרים עבור סוכני AI. מודלי חשיבה (reasoning) מוסיפים על הנטל כיוון שהם כותבים לעצמם הערות ב"שרשרת מחשבה" (chain of thought) וקוראים אותן בחזרה, מה שמגדיל עוד יותר את כמות המידע שיש לנהל.
להלן ארבעה כיוונים חדשניים ופורצי דרך שנועדו לפתור את בעיית הטרנספורמרים ולהפוך את מודלי השפה למהירים, יעילים וחכמים בהרבה.
01: חשיבה מחדש על מנגנון הקשב
דרך ישירה אחת להפוך את מודלי השפה למהירים וזולים יותר היא החלפת הקשב הצפוף במנגנון "קשב דליל" (sparse attention), המבצע חישובים רק על חלק מהצירופים בין המילים בבלוק הטקסט במקום על כולם, ובכך מפחית משמעותית את כמות המחשוב הנדרשת. בעבר, מנגנוני קשב דליל שהוצעו לא היו טובים כמו הקשב הצפוף בלכידת משמעות הטקסט.
מצב זה עשוי להשתנות כעת. חברת הסטארטאפ Subquadratic ממיאמי טוענת כי פיתחה את מנגנון הקשב הדליל הראשון, בשם SubQ, שמציג ביצועים המתחרים במודלים המובילים בשוק במספר משימות, כולל חיפוש וכתיבת קוד. המודל מזהה בזמן אמת עבור כל פיסת טקסט אילו מילים רלוונטיות ואילו אינן חשובות. החברה מתכננת להפוך את המודל לזמין לציבור בקרוב, ולדבריה אלפים כבר נרשמו לרשימת ההמתנה שלה.
במקביל, חברת Manifest AI מסן פרנסיסקו פיתחה מנגנון חלופי המכונה "שימור כוח" (power retention). במקום לשמור על כל המידע בחלון ההקשר, המנגנון מספק סיכום מתגלגל (rolling summary) של המידע הרלוונטי ביותר, ומשמיט פרטים פחות חשובים עם קבלת נתונים חדשים. החברה טוענת כי ניתן להסב מודל טרנספורמר קיים למודל המבוסס על שימור כוח עם אימון מחדש מינימלי. היא הדגימה זאת על ידי הסבת מודל הקוד הפתוח StarCoder לגרסה בשם PowerCoder, וכן שחררה מודל בשם Brumby שלטענתה מתחרה בגרסאות של המודל הפתוח Qwen של Alibaba. מייסד שותף וסמנכ"ל הטכנולוגיות של Manifest AI, קרלס ג'לאדה (Carles Gelada), הדגיש כי הטכנולוגיה מתאימה במיוחד לעיבוד כמויות עצומות של נתונים, החל מניתוח סרטונים של שעות ועד סוכני AI הפועלים שבועות רצופים.
02: מודלים קטנים וגמישים יותר
חברת Liquid AI, שהוקמה כפיצול מ-MIT ובסיסה בקמברידג', מסצ'וסטס, משלבת טרנספורמרים עם טכנולוגיה ייחודית משלה של "רשתות עצביות נוזליות" (liquid neural networks) כדי ליצור מודלי יסוד נוזליים, LFMs. המנכ"ל והמייסד השותף, רמין חסני (Ramin Hasani), מסביר כי המודלים הללו קטנים ויעילים משמעותית. הם מיועדים למערכות כמו שבבים קטנים בכלי רכב של חברת מרצדס (Mercedes), ויכולים לרוץ אפילו על מחשב Raspberry Pi חלש שעלותו 50 דולר בלבד. המודלים מוצעים בחינם לארגונים עם הכנסה שנתית של פחות מ-10 מיליון דולר ורשמו כמעט 34 מיליון הורדות לפי חסני.
הרשתות הנוזליות, ששאבו השראה ממוחן של תולעים, מהוות הרחבה של רשתות קונבולוציה (convolutional networks) ומאפשרות למודל להתאים את התנהגותו למידע חדש בזמן אמת, בניגוד לטרנספורמרים שהתנהגותם מקובעת לחלוטין לאחר שלב האימון. מודלי ה-LFM האחרונים של החברה הם מודלים היברידיים המורכבים מ-20% טרנספורמרים ו-80% רשתות נוזליות, יחס שנקבע באמצעות מערכת בינה מלאכותית מיוחדת שהחברה פיתחה לצורך עיצוב מודליה. המודלים מציגים ביצועים המשתווים למתחרים הגדולים מהם פי ארבעה, דוגמת גרסאות של Qwen או Gemma של גוגל. חסני מציין כי המוח האנושי פועל בצריכת אנרגיה של 20 ואט בלבד, וניתן להיות חדשניים בהרבה בבניית מערכות AI.
03: יצירת טקסט שלם בבת אחת
מרבית מודלי השפה מייצרים פלט מילה אחר מילה, תהליך שאינו יעיל עבור מחשבים. סטארטאפ מפאלטו אלטו בשם Inception מציע לייצר טקסט שלם בבת אחת – משפטים או פסקאות שלמות – באמצעות שימוש בטכניקת "דיפוזיה" (diffusion), המניעה בדרך כלל מודלים ליצירת תמונות ווידאו.
דיפוזיה עובדת על כל הפיקסלים בו-זמנית כדי להפוך רעש סטטי לתמונה ברורה. Inception מיישמת עיקרון זה על טקסט ומאמנת מודלים להפוך מחרוזת מילים אקראית למשפטים הגיוניים. מנכ"ל ומייסד שותף של החברה, סטפנו ארמון (Stefano Ermon), שהוא גם חוקר באוניברסיטת סטנפורד (Stanford), הסביר כי מודלים אלו מהירים וזולים בהרבה כיוון שהם מאפשרים לחזות טוקנים רבים במקביל למרות השימוש בטרנספורמר גדול. בשנת 2024, ארמון ועמיתיו מסטנפורד פיצחו את המתמטיקה של שיטה זו ואימנו מודל דיפוזיה שהשתווה ל-GPT-2 של OpenAI אך היה מהיר ממנו פי 10.
המודל הנוכחי של החברה, Mercury 2, משתווה לביצועי דגמי GPT-4 של OpenAI משנת 2023, אך מהיר מהם פי 10. גם חברת גוגל מתנסה בגישה זו עם אב-טיפוס בשם Diffusion Gemma. ארמון מדגיש כי מהירות ועלות הן המשתנים המכריעים, והמטבע המרכזי בעתיד יהיה רמת האינטליגנציה שניתן לקבל עבור כל דולר.
04: מעבר מעבר למילים
סטארטאפ נוסף מפאלטו אלטו בשם Pathway שואף לשחרר את מודלי השפה ממגבלות המילים, בטענה כי שפה אינה הכלי המתאים ביותר לכל סוגי החשיבה (כמו שחמט או מתמטיקה). החברה פיתחה מודל בשם Dragon Hatchling, שהצליח לפתור מעל 97% מתוך benchmark של 250,000 תשבצי סודוקו קשים במיוחד, משימה שבה נכשלו מודלים מובילים אחרים.
המייסדת השותפה והמנכ"לית, זוזאנה סטמירובסקה (Zuzanna Stamirowska), מסבירה כי החברה מחליפה את מנגנון הקשב במבנה מתמטי המכונה "מרחב מצב" (state space), הדוחס את המידע לייצוג מופשט במקום לקודד אותו מילה אחר מילה. הדבר מאפשר למודל לבצע משימות חשיבה שאינן מבוססות על רצפי מילים. לדבריה, הטרנספורמרים היו פשרה הנדסית נוחה שהפכה ל"דת", אך אין סיבה להניח שלא תתרחש פריצת דרך נוספת שתשנה את התחום ותעזור לפתור בעיות מורכבות כמו ריפוי מחלת הסרטן.