על פי הודעה רשמית שפרסמו סטיבן האנסן (Senior Staff Software Engineer) ופנג שו (Staff Software Engineer) מחטיבת Google DeepMind, חברת גוגל הכריזה על השקת Gemini Robotics ER 2. דגם זה מוגדר כמודל ה-Embodied Reasoning (חשיבה מגולמת) המתקדם ביותר של החברה לרובוטיקה, אשר פותח במטרה לשמש כ"מוח" ברמה גבוהה עבור רובוטים, ומציג שינוי מהותי ביכולות של רובוטים לפעול בעולם הפיזי בעזרת הבנת וידאו, תיאום משימות ושיתוף פעולה רב-רובוטי.
עבור רובוטים הפועלים בסביבות יומיומיות לצד בני אדם, הבנה מרחבית מדויקת אינה מספיקה כשלעצמה. רובוטים נדרשים לחשוב במהירות, לתזמן את החלטותיהם ולבצע תהליכי חשיבה במהירות התואמת את הזמן האמיתי של העולם הפיזי. לשם כך פותח Gemini Robotics ER 2. הדגם מאפשר לרובוטים לנהל שיחות עם בני אדם, להבין את המתרחש בעולם הפיזי ולתכנן משימות מורכבות המורכבות ממספר שלבים. לאחר תכנון המשימה ברמה הגבוהה, המודל מעביר את ביצוע התנועה המוטורית בפועל לכל מודל ראייה-שפה-פעולה (Vision-Language-Action או VLA) ברמה נמוכה יותר.
הדגם החדש מציג שדרוג משמעותי לעומת הדגם הקודם של החברה, Gemini Robotics ER 1.6. באמצעות צפייה בהזרמת וידאו רציפה, רובוטים יכולים כעת לעקוב אחר ההתקדמות של עצמם, להסתגל ולתקן את פעולותיהם אם משהו משתבש, ולדעת בדיוק מתי נכון לעבור לשלב הבא במשימה. בנוסף, המודל מאפשר קריאה מובנית של כלים חיצוניים; הוא מסוגל לקרוא באופן טבעי לכלים כמו מנוע החיפוש Google Search כדי למצוא מידע, או להפעיל כל פונקציה אחרת שהוגדרה על ידי המשתמש. מבנה המודל תוכנן כך שהרובוט מסוגל "לחשוב" על הצעד הבא שלו במקביל לביצוע הפעולות הפיזיות הנוכחיות.
שיפור בתיאום כלים ואינטגרציה ללא השהיות
מרבית המשימות בעולם הפיזי הן מורכבות ודורשות שלבים מרובים להשלמתן. Gemini Robotics ER 2 פועל כסוכן פיזי (physical agent) המנהל את שלבי העבודה עבור הרובוט, ומאפשר לו לבצע תיקון עצמי ולהסתגל למצבים חדשים ובלתי מוכרים. על מנת לבנות מערך מבוסס סוכנים, מפתחים יכולים להצהיר על ממשקי בקרה ברמה נמוכה - כגון מודלי VLA או ממשקי ניתוח וניווט (navigation APIs) - ככלים, ולהזרים נתוני וידאו, שמע או טקסט מולטימוקדיים ישירות אל תוך המודל.
הביצועים של Gemini Robotics ER 2 בתיאום כלים נבחנו על ידי החברה בסימולציות, בבקרת רובוטים פיזיים בעולם האמיתי, ואף בשילוב עם מפעיל אנושי השולט ברובוט מרחוק (human tele-operation). על פי נתוני הבדיקות של גוגל, הדגם החדש עוקף בעקביות את ביצועיו של דגם ER 1.6 בתיאום כלים על פני שלושת מצבי הבקרה שנבדקו: VLA אמיתי בעולם הפיזי, VLA בסביבת סימולציה, ושליטה מרחוק על ידי מפעיל אנושי.
בתחום הרובוטיקה, חשיבה ברמה גבוהה תלויה באופן ישיר במהירות הביצוע. Gemini Robotics ER 2 משתלב ישירות בתוך ה-Gemini Live API, תוך שימוש בנקודת קצה דו-כיוונית להזרמת נתונים (bidirectional streaming endpoint) המותאמת במיוחד למשימות הרגישות לעיכובי תקשורת (latency). השילוב הזה מאפשר תיאום שוטף וזורם: המודל מעביר פקודות למודלי פעולה ולממשקי ה-API של הרובוט מבלי להזדקק לעצירות זמניות ממושכות לצורך "חשיבה" בין שלב לשלב.
כדי להדגים יכולת זו, גוגל בנתה הדגמה יחד עם חברת Boston Dynamics, השותפה שלה לפרויקט, תוך שימוש ברובוט Spot. המפתחים השתמשו ב-Gemini Robotics ER 2 כדי לתאם ולנהל את ממשקי ה-API של Spot, כולל ניווט ותנועת הזרוע הרובוטית (manipulator movement). שילוב זה יצר רובוט אינטראקטיבי המסוגל להביא חפצים למשתמש; כך למשל, המערכת הניעה את Spot להביא חטיף פופקורן בעקבות קבלת פקודה קולית בשפה טבעית. הקוד עבור הדגמה זו ודוגמאות נוספות פורסמו בקוד פתוח ברשת Github.
מעקב אחר התקדמות המשימה ואיתור רגעים מדויק
אחד האתגרים המורכבים ביותר בתחום הרובוטיקה הוא היכולת של המכונה לזהות מתי משימה הושלמה במלואה. Gemini Robotics ER 2 מציג התקדמות משמעותית ביכולות הבנת וידאו ומעקב אחר התקדמות, המאפשרים לו לוודא כי משימות מורכבות - כגון הברגת נורה או קשירת שקית אשפה - הושלמו בדיוק לפי המפרט הנדרש לפני שהוא עובר לבצע את המשימה הבאה בתור. במסגרת עדכון זה, גוגל הציגה פריצת דרך בשתי יכולות יסוד להבנת התקדמות משימות:
ראשית, סיווג התקדמות רציף (Continuous progress classification): יכולת זו מתייחסת ליכולת של הרובוט להעריך ולכמת את רמת ההתקדמות שלו לקראת השלמת המשימה. במסגרת ההערכות שביצעו המפתחים, המודל שייך כל פריים בודד מתוך עדכון הווידאו הרציף לאחת מחמש רמות התקדמות מוגדרות: 0-20%, 20-40%, 40-60%, 60-80% ו-80-100%. באמצעות כימות זה של התקדמות המשימה, המודל מעניק לרובוטים מודעות מצבית בזמן אמת, המאפשרת להם להתאים את פעולותיו תוך כדי תנועה או לנסות שוב שלבים שנכשלו, מבלי להיאלץ להפעיל מחדש את כל זרימת העבודה מההתחלה. במשימות אלו, Gemini Robotics ER 2 השיג דיוק של 57.4%, תוצאה העולה על ביצועי דגמי הדור הקודם ומודלים מתחרים מובילים בשוק.
שנית, איתור רגעים מדויק (Precision moment-finding): מדד זה מעריך את היכולת של המודל לזהות את פריים הווידאו הספציפי שבו מתרחש אירוע קריטי (למשל, זיהוי הרגע המדויק שבו יש להפסיק למזוג קפה לתוך כוס). Gemini Robotics ER 2 מציג שיפור משמעותי בביצועים במשימות אלו, עם דיוק של 91.3% ומרחק מוחלט ממוצע של 0.96 שניות בלבד. המודל מצליח להתחרות בצורה קרובה בקטגוריות של מודלים גדולים בהרבה, אך מספק את הדיוק המרבי הזה בשבריר מעלות החישוב ובמהירות ביצוע הגבוהה פי 4 - מה שמאפשר להגיע לעיכוב תת-שנייה (sub-second latency) הנדרש להפעלה בטוחה של רובוטים בעולם הפיזי.
שיתוף פעולה רב-רובוטי ושיפור אינטליגנציה מרחבית
מאחר שאין רובוט אחד שמתאים בצורה מושלמת לכל משימה - רובוט בעל גלגלים עשוי להצטיין בתנועה בתוך מבנים, בעוד שרובוט דמוי אדם (humanoid) עשוי להצטיין דווקא בתנועה על פני שטח לא ישרים - המודל החדש מאפשר שיתוף פעולה בין מספר רובוטים שונים. Gemini Robotics ER 2 מאפשר למכונות מגוונות לתקשר זו עם זו על בסיס הבנה סמנטית משותפת, ובכך להעביר משימות ושלבי עבודה מאחד לשני כדי להשלים פרויקטים מורכבים שרובוט בודד אינו מסוגל לבצע בכוחות עצמו. גוגל הדגימה יכולת זו באמצעות שיתוף פעולה שבוצע בין הרובוט Apollo 2 של חברת Apptronik לבין הרובוט Franka F3 Duo, העובדים יחד במרחב משותף.
בנוסף לשיתוף הפעולה, Gemini Robotics ER 2 מציג שיפור באינטליגנציה המרחבית הבסיסית שלו, כפי שנמדד בשלושה מבחנים מוגדרים:
- זיהוי הצלחה או כישלון: המודל פועל כעת על גבי עדכוני וידאו גולמיים במקום להסתמך על צילומי מסך (snapshots) סטטיים, ובכך מסוגל לזהות כשלים המתרחשים תוך כדי ביצוע הפעולה, כגון שפיכת חומרים, החלקות או חוסר התאמה וסטייה של המיקום.
- קריאת מכשירים כללית: יכולת קריאת המכשירים של המודל הורחבה מעבר לשעוני מדידה עגולים וזכוכיות תצפית סטנדרטיות, וכעת היא כוללת גם צגים דיגיטליים, סולמות ליניאריים, סרגלים ומדי חום מבוססי נוזל. החברה בחנה יכולת זו על פני 10 סוגים שונים של מכשירי מדידה.
- מענה לשאלות ויזואליות מרחביות (VQA) משופר: שיפור משמעותי ביכולת המענה לשאלות ויזואליות (Visual Question Answering), הודות להתקדמות הכללית של מודלי Gemini בהבנה מולטימוקדית.
בטיחות מתקדמת ומבחני הערכה חדשים
היבט מרכזי נוסף בפיתוח המודל הוא הבטיחות. Gemini Robotics ER 2 מוגדר כמודל הבטוח ביותר של גוגל בתחום זה עד כה, והוא השיג שיפורים משמעותיים במבחני ביצוע של מעקב אחר הוראות בטיחות (Safety Instruction Following) ומבחני קרבה לבני אדם (Human Proximity). מבחנים אלו מעריכים כיצד המודל נשמע למגבלות פיזיות מוגדרות במהלך ביצוע משימות חשיבה, ואת המודעות המרחבית שלו לצורך זיהוי נוכחות אנושית בסביבתו.
במהלך הבדיקות, נמצא כי המודל מצליח לעציר באופן מיידי ובצורה בטוחה רובוט דמוי אדם כאשר אדם מתקרב לקרבתו, ומחדש את העבודה באופן אוטונומי רק לאחר שהשטח התפנה לחלוטין. על מנת לקדם את תחום הבטיחות עבור סוכנים פיזיים, גוגל מציגה מדד הערכה (benchmark) חדש לחלוטין. מדד זה בוחן את היכולת של מודל יסוד לתפקד כמתאם VLA בטוח באמצעות בדיקת יכולתו לאכוף מגבלות בטיחות, לנטר באופן פעיל את הסביבה הפיזית, להעריך היתכנות פיזית של פעולות ולבקש הבהרות ממפעיל אנושי במקרה של חוסר ודאות. פרטים מלאים על יכולות אלו מופיעים בדוח הטכני של גוגל בנושאי בטיחות.
לפי הודעת צוות המפתחים בגוגל, התוכניות לעתיד כוללות המשך פיתוח של המודלים הללו לקראת פתרון משימות מורכבות עוד יותר, במטרה להאיץ את פיתוחם של רובוטים מסייעים שימושיים ולתמוך בצורה רחבה בקהילת הרובוטיקה העולמית.