בפוסט שפורסם בבלוג המחקר של גוגל על ידי חוקרי המחקר ייל סונג (Yale Song) וייוון סונג (Yiwen Song), הוצגה מסגרת מרובת סוכנים מאוחדת ליצירה אוטונומית של נרטיבים בווידאו ארוך בעלי עקביות לאורך זמן. החוקרים ציינו כי בעוד שמודלי דיפוזיה מסוגלים לייצר קטעי וידאו באיכות גבוהה תוך שניות, הפיכתם למנועי סיפור סיפורים (storytelling) קוהרנטיים וארוכים נותרה אתגר משמעותי. רוב הצינורות מבוססי הסוכנים הקיימים מבצעים אוטומציה של התהליך באמצעות שרשור מודולים, אך סובלים מסחיפה סמנטית (semantic drift) דוגמת שינויים קלים בלבוש הדמויות או בנוף בין שוטים, ומכשלים מדורגים (cascading failures) שבהם פגם בנכס מוקדם פוגע ביצירת הווידאו בהמשך.
לפי החוקרים, כשלים אלה נובעים מהנדסת פרומפטים ידנית ועצמאית, וכיוון ששגיאות מוקדמות מתפשטות ופוגעות בעקביות ארוכת הטווח, התהליך דורש לעיתים קרובות התערבות ידנית מקיפה. מבחינה מבנית, הדבר משקף את בעיית ייחוס הקרדיט (credit assignment problem), שכן קשה להתחקות אחר כשלים סופיים בחזרה לפרומפטים ספציפיים. בנוסף, שיטות קיימות סובלות מסחיפת מאפיינים (feature drift), שבה ישויות וסביבות משתנות בהדרגה ללא כוונה, או מקריסת תוכן (content collapse), שבה הנרטיב אינו מתקדם באופן בעל משמעות. המחקר של גוגל מציג מערך של ארבע מסגרות עבודה — Co-Director, CANVAS, A²RD ו-VQQA — המיועדות לתרגם הנחיות יצירתיות אנושיות ברמה גבוהה לביצוע באמצעות אוטומציה של משימות תזמור חוזרות, מפרומפטים מרובי מודלים ושרשור שוטים ועד שכלול חזותי בלולאה סגורה.
תזמור הכוונה היצירתית באמצעות AI Video Co-Director
כדי להבטיח קוהרנטיות סמנטית לאורך וידאו שלם, החוקרים מציגים את AI video co-director, מסגרת היררכית מרובת סוכנים המגדירה יצירת סיפור בווידאו כבעיית אופטימיזציה גלובלית. במקום להסתמך על שרשראות פרומפטים ליניאריות וקשיחות, המסגרת מציגה פרמטריזציה היררכית: אלגוריתם שודד רב-זרועות (Multi-Armed Bandit - MAB) מזהה ברמה הגלובלית כיוונים יצירתיים מבטיחים, ומאזן בין חקירת (exploration) אסטרטגיות נרטיביות חדשות לבין ניצול (exploitation) תצורות יצירתיות יעילות. המערכת דוגמת מסלולים יצירתיים מופשטים — כגון שילוב בין אסטרטגיה אינפורמטיבית, מצב נרטיבי מסוג וינייטה וארכיטיפ אסתטי מוגדר — ומזריקה אותם באופן דינמי לפרומפטים של תת-הסוכנים.
התזמור מבוצע בשני מסלולים מקושרים: הכוונה אסטרטגית והפקה רב-שלבית. סוכן התזמור (Orchestrator Agent) בוחר תצורה יצירתית לאורך שלושה ממדים: אסטרטגיה יצירתית (כוונה), מצב נרטיבי (מבנה הסיפור) וארכיטיפ אסתטי (טון חזותי וצילום). סוכן קדם-ההפקה (Pre-Production Agent) מסנתז תקציר עלילתי של סצנה-אחר-סצנה ונכסים חזותיים לכדי לוח תכנון (storyboard) אחיד. סוכן ההפקה (Production Agent) מתרגם את לוח התכנון למדיה באמצעות תת-סוכנים ייעודיים: סוכן Keyframe המעגן את חזות הדמויות והסצנה, סוכן וידאו המוסיף תנועה, וסוכן אודיו המוסיף קריינות ופסקול תואמים. שופט מבוסס מודל שפה-חזות רב-מודאלי (MLLM Judge) מעריך את הגרסה הסופית ומחזיר אות תגמול מפורק אל ה-MAB לצורך שכלול ואופטימיזציה בלולאות יצירה עוקבות. כיוון שהמסגרת יושבת כשכבת תזמור מעל Gemini ו-Veo, תוצרי התמונה, הווידאו והאודיו יורשים מנגנוני בטיחות דוגמת סימון מים של SynthID, וניתן להחיל מסווגי בטיחות נוספים על הווידאו הסופי.
תכנון עקביות חזותית באמצעות CANVAS
כדי לפתור שבירת עקביות ושינויי דמויות בין שוטים עוקבים ולא-עוקבים, גוגל מציגה את CANVAS (Continuity-Aware Narratives via Visual Agentic Storyboarding). מסגרת זו פועלת כשכבת תזמור מעל Gemini ושומרת על ייצוגים מובנים של דמויות, מיקומים ומצבי עצמים לאורך התפתחות הנרטיב, תוך הישענות על זיכרון חזותי מתמשך. על ידי שליפת עוגנים חזותיים מהזיכרון או יצירת חדשים בעת הצורך, המערכת מתוכננת להבטיח מעברים חלקים ושמירה על זהות הדמויות והמבנה המרחבי של הסביבות כאשר חוזרים אליהן.
בבדיקה שהוצגה בפוסט על גבי רצף שוד במוזיאון מתוך HardContinuityBench, הושווה CANVAS למודל הבסיס Gemini-3.1-Pro וכן למסגרת מרובת סוכנים חלופית בשם AutoStudio. לפי המוצג במחקר, יצירה ישירה באמצעות Gemini-3.1-Pro הציגה חוסר עקביות בעצמים וסחיפת רקע שבה פריסת החדר השתנתה. AutoStudio הציג סחיפת דמויות שבה כובעו של הגנב נעלם במעברים. לעומת זאת, CANVAS שמר על עקביות של הדמויות, הגאומטריה המרחבית ומצבי העצמים לאורך הנרטיב הודות לזיכרון החזותי המתמשך.
ניהול דינמיקה לאורך זמן באמצעות A²RD
עבור תרגום לוחות התכנון לווידאו באורך דקות, פותחה ארכיטקטורת A²RD ליצירת וידאו אוטורגרסיבית מבוססת סוכנים. A²RD פועל ביצירה מקטע-אחר-מקטע הנתמכת בזיכרון וידאו רב-מודאלי העוקב אחר ההקשר והדינמיקה של המקטעים. בכל מקטע, הסוכן פועל בלולאה של שליפה-סנתוז-שכלול-עדכון (retrieve-synthesize-refine-update).
חלק מרכזי בלולאה זו הוא היכולת לקבוע באופן מסתגל את מצב היצירה של המקטע: מעבר בין אקסטרפולציה (extrapolation) כדי לאפשר התקדמות נרטיבית טבעית, לבין אינטרפולציה (interpolation) המעגנת מקטעים לישויות ולסביבות קיימות. בניסוי שהציגו החוקרים בסרט באורך עשר דקות, המערכת תישלה באופן רציף את זיכרון הווידאו הרב-מודאלי כדי לשמר את זהות הדמויות, פרטי התלבושות והגאומטריה המבנית לאורך פערי זמן של דקות מרובות.
שכלול בלולאה סגורה עם VQQA וממצאי הערכה
כדי לזהות ולתקן פגמים חזותיים באופן אוטונומי מבלי להסתמך על גישת קופסה לבנה למודל, פותחה מסגרת VQQA (Video Quality Question Answering). המסגרת מייצרת שאלות חזותיות המותאמות לפרומפט הספציפי ומשתמשת בביקורות של מודל ראייה-שפה (VLM) כגרדיאנטים סמנטיים (semantic gradients) — משוב כיווני בשפה טבעית המנחה שכלול איטרטיבי, בדומה לגרדיאנטים נומריים. VQQA פועלת כאופטימייזר פרומפטים בקופסה שחורה: במקום לשנות פיקסלים ישירות, היא משכללת את הפרומפט הטקסטואלי כדי לתקן פגמי קומפוזיציה כמו שגיאות צימוד תכונות (attribute binding) או חוסר עקביות של דמויות, ומנחה את מחולל הווידאו לדגום נתיב חדש במרחב הלטנטי. כדי למנוע סחיפה סמנטית במהלך השיפור, מנגנון Global Selection מעריך כל וידאו שנוצר לאורך מסלול האופטימיזציה אל מול הפרומפט המקורי ובוחר במועמד בעל הציון הגבוה ביותר.
להערכת המסגרות, החוקרים פיתחו שלושה מבחני ביצועים (benchmarks): מבחן GenAD-Bench הכולל 50 מותגים בדיוניים עם ארבעה מוצרים כל אחד ב-400 תרחישים; מבחן HardContinuityBench הבודק עקביות מרחבית וסביבתית עם פערי היעלמות גדולים; ומבחן LVBench-C הכולל 120 תרחישי טקסט שבהם נכסים קריטיים נעלמים ללפחות 10 מקטעים לפני חזרתם. בהערכות, AI video co-director השיג ציון איכות שיא של 81.4 ב-GenAD-Bench, בעוד CANVAS הציג שיפורים בעקביות ב-ST-Bench ו-HardContinuityBench. ארכיטקטורת A²RD הפחיתה סחיפת פריסה במבחני VBench-Long ו-LVBench-C, ו-VQQA השיג שיפורי איכות במבחני T2V-CompBench, VBench2 ו-VBench-I2V. החוקרים ציינו כי מטרתם אינה להחליף מספרי סיפורים אנושיים, אלא לסייע להם על ידי נטילת המורכבויות של מעקב אחר מצב העולם ועקביות לאורך זמן.