בעידן שבו מהירות עיבוד שפה טבעית קובעת את קצב החדשנות בעסקים, חוקרים מפתחים את dUltra – מסגרת למידה מחוזקת חדשה שמאיצה באופן דרמטי את מודלי השפה הדיפוזיה המוסתרים (MDLMs). מודלים אלה מבטיחים יצירה מקבילה של אסימונים, אך בפועל הם מייצרים פחות מ-5 אסימונים בכל מעבר מודל, מה שהופך את מהירותם לדומה לזו של שיטות אוטורגרסיביות עם ניחושים ספקולטיביים. dUltra שוברת את המחסום הזה ומשפרת את יחס הדיוק-יעילות.
לפי המחקר, שיטות האצה קיימות כמו dParallel ו-d3LLM מבוססות זיקוק (distillation) ומשתמשות במסלולים שנוצרו על ידי מודל בסיס, מה שגורם לסטייה ממדיניות אופטימלית ומגביל את הביצועים לאיכות הדגימות של המודל הבסיסי. dUltra מציגה גישה מבוססת למידה מחוזקת על-מדיניות (on-policy) באמצעות אופטימיזציית מדיניות יחסית קבוצתית (GRPO). היא כוללת ראש תכנון הסרת-מסכה שחוזה הסתברויות הסרה עצמאיות לכל אסימון תחת חלוקות ברנולי.
השיטה מייעלת במשותף את מודל השפה הדיפוזיה הבסיסי ואת מתכנן סדר ההסרה באמצעות אותות תגמול המשלבים תגמול ניתן לאימות, תגמול זיקוק ומספר צעדי הסרת המסכה. תהליך זה מאפשר אסטרטגיות הסרה יעילות ליצירה מקבילה מהירה יותר, תוך שמירה על דיוק גבוה.
במבחנים על משימות חישוב מתמטי ויצירת קוד, dUltra משפרת את יחס הדיוק-יעילות על פני שיטות cliff baselines מבוססות cliff cliff cliff heuristics וזיקוקים מתקדמים. היא מתקרבת ל'שליטת הדיפוזיה' על פני מודלים אוטורגרסיביים מסורתיים, מה שמצביע על פוטנציאל לשינוי פרדיגמה בשוק ה-AI.
למנהלי עסקים ישראליים בתחום הטכנולוגיה, dUltra מבטיחה כלים מהירים יותר לפיתוח יישומי AI, במיוחד בתחומי קוד ומתמטיקה שרלוונטיים לתעשיית ההייטק המקומית. כיצד תשלבו את ההאצה הזו בפרויקטים הבאים שלכם?