גוגל משיקה את Gemini Robotics ER 2: מוח בינה מלאכותית לרובוטים
מוצר חדש

גוגל משיקה את Gemini Robotics ER 2: מוח בינה מלאכותית לרובוטים

הדגם החדש מציג שיפור בהבנת וידאו, תיאום כלים בזמן אמת ושיתוף פעולה רב-רובוטי

4 דקות קריאה
מבוסס על כתבה שלDeepMindתרגום וסיכום באמצעות מערכת חדשות בליווי AIאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • הדגם החדש Gemini Robotics ER 2 משמש כ'מוח' רובוטי ברמה גבוהה המעביר פקודות למודלי VLA מוטוריים נמוכים.

  • הישגים משמעותיים במעקב אחר משימות: דיוק של 57.4% בסיווג 5 רמות התקדמות ודיוק של 91.3% באיתור רגעים קריטיים.

  • המודל נבדק ב-3 מצבי שליטה (VLA אמיתי, VLA בסימולציה, ושליטה אנושית מרחוק) והציג ביצועים העולים על דגם 1.6.

  • מערכת הבטיחות של המודל מסוגלת לזהות קרבת בני אדם ולעצור אוטומטית רובוט דמוי אדם עד לפינוי האזור.

גוגל משיקה את Gemini Robotics ER 2: מוח בינה מלאכותית לרובוטים

  • הדגם החדש Gemini Robotics ER 2 משמש כ'מוח' רובוטי ברמה גבוהה המעביר פקודות למודלי VLA...
  • הישגים משמעותיים במעקב אחר משימות: דיוק של 57.4% בסיווג 5 רמות התקדמות ודיוק של 91.3%...
  • המודל נבדק ב-3 מצבי שליטה (VLA אמיתי, VLA בסימולציה, ושליטה אנושית מרחוק) והציג ביצועים העולים...
  • מערכת הבטיחות של המודל מסוגלת לזהות קרבת בני אדם ולעצור אוטומטית רובוט דמוי אדם עד...

על פי הודעה רשמית שפרסמו סטיבן האנסן (Senior Staff Software Engineer) ופנג שו (Staff Software Engineer) מחטיבת Google DeepMind, חברת גוגל הכריזה על השקת Gemini Robotics ER 2. דגם זה מוגדר כמודל ה-Embodied Reasoning (חשיבה מגולמת) המתקדם ביותר של החברה לרובוטיקה, אשר פותח במטרה לשמש כ"מוח" ברמה גבוהה עבור רובוטים, ומציג שינוי מהותי ביכולות של רובוטים לפעול בעולם הפיזי בעזרת הבנת וידאו, תיאום משימות ושיתוף פעולה רב-רובוטי.

עבור רובוטים הפועלים בסביבות יומיומיות לצד בני אדם, הבנה מרחבית מדויקת אינה מספיקה כשלעצמה. רובוטים נדרשים לחשוב במהירות, לתזמן את החלטותיהם ולבצע תהליכי חשיבה במהירות התואמת את הזמן האמיתי של העולם הפיזי. לשם כך פותח Gemini Robotics ER 2. הדגם מאפשר לרובוטים לנהל שיחות עם בני אדם, להבין את המתרחש בעולם הפיזי ולתכנן משימות מורכבות המורכבות ממספר שלבים. לאחר תכנון המשימה ברמה הגבוהה, המודל מעביר את ביצוע התנועה המוטורית בפועל לכל מודל ראייה-שפה-פעולה (Vision-Language-Action או VLA) ברמה נמוכה יותר.

הדגם החדש מציג שדרוג משמעותי לעומת הדגם הקודם של החברה, Gemini Robotics ER 1.6. באמצעות צפייה בהזרמת וידאו רציפה, רובוטים יכולים כעת לעקוב אחר ההתקדמות של עצמם, להסתגל ולתקן את פעולותיהם אם משהו משתבש, ולדעת בדיוק מתי נכון לעבור לשלב הבא במשימה. בנוסף, המודל מאפשר קריאה מובנית של כלים חיצוניים; הוא מסוגל לקרוא באופן טבעי לכלים כמו מנוע החיפוש Google Search כדי למצוא מידע, או להפעיל כל פונקציה אחרת שהוגדרה על ידי המשתמש. מבנה המודל תוכנן כך שהרובוט מסוגל "לחשוב" על הצעד הבא שלו במקביל לביצוע הפעולות הפיזיות הנוכחיות.

שיפור בתיאום כלים ואינטגרציה ללא השהיות

מרבית המשימות בעולם הפיזי הן מורכבות ודורשות שלבים מרובים להשלמתן. Gemini Robotics ER 2 פועל כסוכן פיזי (physical agent) המנהל את שלבי העבודה עבור הרובוט, ומאפשר לו לבצע תיקון עצמי ולהסתגל למצבים חדשים ובלתי מוכרים. על מנת לבנות מערך מבוסס סוכנים, מפתחים יכולים להצהיר על ממשקי בקרה ברמה נמוכה - כגון מודלי VLA או ממשקי ניתוח וניווט (navigation APIs) - ככלים, ולהזרים נתוני וידאו, שמע או טקסט מולטימוקדיים ישירות אל תוך המודל.

הביצועים של Gemini Robotics ER 2 בתיאום כלים נבחנו על ידי החברה בסימולציות, בבקרת רובוטים פיזיים בעולם האמיתי, ואף בשילוב עם מפעיל אנושי השולט ברובוט מרחוק (human tele-operation). על פי נתוני הבדיקות של גוגל, הדגם החדש עוקף בעקביות את ביצועיו של דגם ER 1.6 בתיאום כלים על פני שלושת מצבי הבקרה שנבדקו: VLA אמיתי בעולם הפיזי, VLA בסביבת סימולציה, ושליטה מרחוק על ידי מפעיל אנושי.

בתחום הרובוטיקה, חשיבה ברמה גבוהה תלויה באופן ישיר במהירות הביצוע. Gemini Robotics ER 2 משתלב ישירות בתוך ה-Gemini Live API, תוך שימוש בנקודת קצה דו-כיוונית להזרמת נתונים (bidirectional streaming endpoint) המותאמת במיוחד למשימות הרגישות לעיכובי תקשורת (latency). השילוב הזה מאפשר תיאום שוטף וזורם: המודל מעביר פקודות למודלי פעולה ולממשקי ה-API של הרובוט מבלי להזדקק לעצירות זמניות ממושכות לצורך "חשיבה" בין שלב לשלב.

כדי להדגים יכולת זו, גוגל בנתה הדגמה יחד עם חברת Boston Dynamics, השותפה שלה לפרויקט, תוך שימוש ברובוט Spot. המפתחים השתמשו ב-Gemini Robotics ER 2 כדי לתאם ולנהל את ממשקי ה-API של Spot, כולל ניווט ותנועת הזרוע הרובוטית (manipulator movement). שילוב זה יצר רובוט אינטראקטיבי המסוגל להביא חפצים למשתמש; כך למשל, המערכת הניעה את Spot להביא חטיף פופקורן בעקבות קבלת פקודה קולית בשפה טבעית. הקוד עבור הדגמה זו ודוגמאות נוספות פורסמו בקוד פתוח ברשת Github.

מעקב אחר התקדמות המשימה ואיתור רגעים מדויק

אחד האתגרים המורכבים ביותר בתחום הרובוטיקה הוא היכולת של המכונה לזהות מתי משימה הושלמה במלואה. Gemini Robotics ER 2 מציג התקדמות משמעותית ביכולות הבנת וידאו ומעקב אחר התקדמות, המאפשרים לו לוודא כי משימות מורכבות - כגון הברגת נורה או קשירת שקית אשפה - הושלמו בדיוק לפי המפרט הנדרש לפני שהוא עובר לבצע את המשימה הבאה בתור. במסגרת עדכון זה, גוגל הציגה פריצת דרך בשתי יכולות יסוד להבנת התקדמות משימות:

ראשית, סיווג התקדמות רציף (Continuous progress classification): יכולת זו מתייחסת ליכולת של הרובוט להעריך ולכמת את רמת ההתקדמות שלו לקראת השלמת המשימה. במסגרת ההערכות שביצעו המפתחים, המודל שייך כל פריים בודד מתוך עדכון הווידאו הרציף לאחת מחמש רמות התקדמות מוגדרות: 0-20%, 20-40%, 40-60%, 60-80% ו-80-100%. באמצעות כימות זה של התקדמות המשימה, המודל מעניק לרובוטים מודעות מצבית בזמן אמת, המאפשרת להם להתאים את פעולותיו תוך כדי תנועה או לנסות שוב שלבים שנכשלו, מבלי להיאלץ להפעיל מחדש את כל זרימת העבודה מההתחלה. במשימות אלו, Gemini Robotics ER 2 השיג דיוק של 57.4%, תוצאה העולה על ביצועי דגמי הדור הקודם ומודלים מתחרים מובילים בשוק.

שנית, איתור רגעים מדויק (Precision moment-finding): מדד זה מעריך את היכולת של המודל לזהות את פריים הווידאו הספציפי שבו מתרחש אירוע קריטי (למשל, זיהוי הרגע המדויק שבו יש להפסיק למזוג קפה לתוך כוס). Gemini Robotics ER 2 מציג שיפור משמעותי בביצועים במשימות אלו, עם דיוק של 91.3% ומרחק מוחלט ממוצע של 0.96 שניות בלבד. המודל מצליח להתחרות בצורה קרובה בקטגוריות של מודלים גדולים בהרבה, אך מספק את הדיוק המרבי הזה בשבריר מעלות החישוב ובמהירות ביצוע הגבוהה פי 4 - מה שמאפשר להגיע לעיכוב תת-שנייה (sub-second latency) הנדרש להפעלה בטוחה של רובוטים בעולם הפיזי.

שיתוף פעולה רב-רובוטי ושיפור אינטליגנציה מרחבית

מאחר שאין רובוט אחד שמתאים בצורה מושלמת לכל משימה - רובוט בעל גלגלים עשוי להצטיין בתנועה בתוך מבנים, בעוד שרובוט דמוי אדם (humanoid) עשוי להצטיין דווקא בתנועה על פני שטח לא ישרים - המודל החדש מאפשר שיתוף פעולה בין מספר רובוטים שונים. Gemini Robotics ER 2 מאפשר למכונות מגוונות לתקשר זו עם זו על בסיס הבנה סמנטית משותפת, ובכך להעביר משימות ושלבי עבודה מאחד לשני כדי להשלים פרויקטים מורכבים שרובוט בודד אינו מסוגל לבצע בכוחות עצמו. גוגל הדגימה יכולת זו באמצעות שיתוף פעולה שבוצע בין הרובוט Apollo 2 של חברת Apptronik לבין הרובוט Franka F3 Duo, העובדים יחד במרחב משותף.

בנוסף לשיתוף הפעולה, Gemini Robotics ER 2 מציג שיפור באינטליגנציה המרחבית הבסיסית שלו, כפי שנמדד בשלושה מבחנים מוגדרים:

  • זיהוי הצלחה או כישלון: המודל פועל כעת על גבי עדכוני וידאו גולמיים במקום להסתמך על צילומי מסך (snapshots) סטטיים, ובכך מסוגל לזהות כשלים המתרחשים תוך כדי ביצוע הפעולה, כגון שפיכת חומרים, החלקות או חוסר התאמה וסטייה של המיקום.
  • קריאת מכשירים כללית: יכולת קריאת המכשירים של המודל הורחבה מעבר לשעוני מדידה עגולים וזכוכיות תצפית סטנדרטיות, וכעת היא כוללת גם צגים דיגיטליים, סולמות ליניאריים, סרגלים ומדי חום מבוססי נוזל. החברה בחנה יכולת זו על פני 10 סוגים שונים של מכשירי מדידה.
  • מענה לשאלות ויזואליות מרחביות (VQA) משופר: שיפור משמעותי ביכולת המענה לשאלות ויזואליות (Visual Question Answering), הודות להתקדמות הכללית של מודלי Gemini בהבנה מולטימוקדית.

בטיחות מתקדמת ומבחני הערכה חדשים

היבט מרכזי נוסף בפיתוח המודל הוא הבטיחות. Gemini Robotics ER 2 מוגדר כמודל הבטוח ביותר של גוגל בתחום זה עד כה, והוא השיג שיפורים משמעותיים במבחני ביצוע של מעקב אחר הוראות בטיחות (Safety Instruction Following) ומבחני קרבה לבני אדם (Human Proximity). מבחנים אלו מעריכים כיצד המודל נשמע למגבלות פיזיות מוגדרות במהלך ביצוע משימות חשיבה, ואת המודעות המרחבית שלו לצורך זיהוי נוכחות אנושית בסביבתו.

במהלך הבדיקות, נמצא כי המודל מצליח לעציר באופן מיידי ובצורה בטוחה רובוט דמוי אדם כאשר אדם מתקרב לקרבתו, ומחדש את העבודה באופן אוטונומי רק לאחר שהשטח התפנה לחלוטין. על מנת לקדם את תחום הבטיחות עבור סוכנים פיזיים, גוגל מציגה מדד הערכה (benchmark) חדש לחלוטין. מדד זה בוחן את היכולת של מודל יסוד לתפקד כמתאם VLA בטוח באמצעות בדיקת יכולתו לאכוף מגבלות בטיחות, לנטר באופן פעיל את הסביבה הפיזית, להעריך היתכנות פיזית של פעולות ולבקש הבהרות ממפעיל אנושי במקרה של חוסר ודאות. פרטים מלאים על יכולות אלו מופיעים בדוח הטכני של גוגל בנושאי בטיחות.

לפי הודעת צוות המפתחים בגוגל, התוכניות לעתיד כוללות המשך פיתוח של המודלים הללו לקראת פתרון משימות מורכבות עוד יותר, במטרה להאיץ את פיתוחם של רובוטים מסייעים שימושיים ולתמוך בצורה רחבה בקהילת הרובוטיקה העולמית.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה באמצעות מערכת בליווי בינה מלאכותית לתרגום, סיכום ובקרות איכות אוטומטיות מתוך פרסום מקורי של DeepMind. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

קבלו עדכוני AI שימושיים למייל

תקציר ממוקד ממערכת החדשות שלנו.

גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב
חדשות
3 דקות
מ־DeepMind

גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב

בבלוג הרשמי של גוגל קלאוד הוכרז על הרחבת התמיכה של החברה במשימת ג'נסיס (Genesis Mission) הלאומית של ארצות הברית, באמצעות הקצאה של 40 מיליון דולר באסימוני בינה מלאכותית ובקרדיטים לענן. גוגל תעניק למעבדות הלאומיות של משרד האנרגיה האמריקאי (DOE) גישה לכלי בינה מלאכותית מתקדמים מבית Google DeepMind, בהם AlphaEvolve, AlphaFold 3 ו-AlphaGenome, לצד רישיונות שימוש ב-Gemini for Government למשך שנה עבור עשרות אלפי עובדים. הכלים כבר משולבים במעבדות כגון PNNL ו-NLR, ומסייעים בקיצור זמני כיול חומרה ובמיפוי מערכות מתמטיות מורכבות.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים
מוצר חדש
4 דקות
מ־DeepMind

יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים

חברת Google DeepMind (חטיבת הבינה המלאכותית של גוגל) השיקה שני מודלים חדשים למפתחים: Nano Banana 2 Lite ליצירת תמונות מהירה במיוחד ו-Gemini Omni Flash ליצירת וידאו ועריכה שיחתית. לפי הנתונים הרשמיים, Nano Banana 2 Lite מייצר תמונות בתוך 4 שניות בלבד בעלות של 0.034 דולר ל-1,000 תמונות, ומחליף את מודל הדור הקודם gemini-2.5-flash-image. במקביל, Gemini Omni Flash מאפשר יצירת סרטוני וידאו של עד 10 שניות בעלות תחרותית של 0.10 דולר לשנייה. שני המודלים זמינים כעת ב-Google AI Studio ובממשק ה-Gemini API, ומאפשרים לעסקים למכור ולייצר תוכן ויזואלי אינטראקטיבי ואוטומטי בקנה מידה רחב.

קרא עוד
גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4
מוצר חדש
4 דקות
מ־DeepMind

גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4

חברת גוגל (Google) השיקה את DiffusionGemma, מודל קוד פתוח ניסיוני מבוסס טכנולוגיית דיפוזיית טקסט המציע מהירות יצירת טקסט הגבוהה פי 4 בהשוואה למודלים אוטו-רגרסיביים מסורתיים. המודל, המבוסס על סדרת Gemma 4, משלב ארכיטקטורת Mixture of Experts (MoE) עם 26 מיליארד פרמטרים (מתוכם 3.8 מיליארד פעילים בהסקה) ומעבד פסקאות שלמות במקביל במקום מילה אחר מילה. תכונה זו פותרת את צווארי הבקבוק של חומרת קצה ומאפשרת ביצועים של מעל 1,000 אסימונים בשנייה על כרטיסי מסך ארגוניים. עבור עסקים בישראל, פריצת דרך זו מאפשרת הרצת יישומי בינה מלאכותית מקומיים ומאובטחים לחלוטין התואמים את חוק הגנת הפרטיות, ללא תלות בענן ציבורי.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
Amazon Quick זמין כעת באופן כללי למחשב השולחני
מוצר חדש
4 דקות
מ־AWS Machine Learning

Amazon Quick זמין כעת באופן כללי למחשב השולחני

אפליקציית הדסקטופ של Amazon Quick זמינה כעת באופן כללי למשתמשי macOS ו-Windows, ובמקביל נוסף פיד פעילות למובייל ב-iOS וב-Android. המערכת מרכזת נתונים מדואר אלקטרוני, מיומן פגישות, ממערכות CRM ומהודעות לתצוגה מתועדפת אחת, כאשר סוכני AI מטפלים במשימות שגרתיות ברקע. Quick פועל על גבי תשתיות AWS ושומר על נתוני הארגון בסביבתו המקומית, כולל תמיכה במעקב ביקורת דרך CloudWatch ו-CloudTrail והסמכות תאימות דוגמת HIPAA, FedRAMP, SOC 2 ו-ISO 27001. לקוחות בארגונים כמו Southwest Airlines, LabCorp ו-PGA TOUR משתמשים בכלי להשלמת משימות, סינתזת מידע ופיתוח אבות-טיפוס.

קרא עוד
סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח
מוצר חדש
4 דקות
מ־Salesforce Blog

סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח

סיילספורס הציגה את Scheduling Agent במסגרת Agentforce Field Service, סוכן בינה מלאכותית הפועל 24/7 לתיאום, שינוי וביטול פגישות שירות שטח. הסוכן מחובר לנתוני הלקוחות, ללוחות הזמנים של הטכנאים ולמנוע האופטימיזציה של הארגון, ופועל בערוצי תקשורת מגוונים בהם וואטסאפ, דוא"ל, SMS, iMessage ושיחות קוליות. המערכת מבוססת על Agent Script לקבלת החלטות דטרמיניסטית ואכיפת כללים עסקיים ללא ניחושים של מודלי שפה, ומספקת מענה לפניות לקוחות, סדרנים, טכנאים וטריגרים מנכסים. המערכת תוצג בכנס Dreamforce וב-Salesforce+.

קרא עוד
אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow
מוצר חדש
4 דקות
מ־SiliconANGLE AI

אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow

חברת Experian משיקה את מערכת Agent OS ומעמיקה את פעילותה בתחום סוכני ה-AI באמצעות שותפות ראשונה עם ServiceNow. הפלטפורמה מאפשרת לשלב יכולות ניהול סיכונים, אימות וקבלת החלטות בתהליכי עבודה ארגוניים, תוך חיבור לפלטפורמת Ascend של אקספריאן. המערכת כוללת מנגנוני אבטחה מחמירים, שער בקרה על תעבורה, בדיקות אדברסריות ושמירה על מעורבות אנושית בהחלטות מפוקחות רגולטורית. הפתרון נגיש באמצעות ממשקי API ושרת MCP ומאפשר החלפת מודלים לפי עומס העבודה.

קרא עוד
שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון
מוצר חדש
4 דקות
מ־Salesforce Blog

שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון

לפי פרסום של צוות Agentforce מבית Salesforce, תזמור מרובה-סוכנים (Multi-agent orchestration) זמין כעת באופן כללי. הפרסום מציג שלושה סימנים לכך שסוכן AI בודד הגיע לקצה גבול היכולת שלו: הסוכן מנסה לבצע משימות רבות מדי וסובל מהתנגשות כוונות (Intent collision), הנתונים הנדרשים נמצאים מחוץ לגבולות ה-Salesforce org, או שצוותים שונים נדרשים לנהל חלקים שונים של הסוכן. המאמר מציג ארבעה נתיבי ארכיטקטורה ושאלות מוכנות לבחינת המעבר, ומציין כי בבדיקות פנימיות בעיות הסקה מתרחשות לרוב מעבר לשבעה תת-סוכנים.

קרא עוד