לפי סקירה שפרסמה גוגל קלאוד (Google Cloud) על חידושים בתשתיות AI ותזמור (Orchestration), החברה הציגה שורת עדכוני מוצר, מדריכים טכניים, דוחות מחקר וסיפורי לקוחות עבור מחשוב, רשתות, אחסון, סביבות עבודה ותוכנות תזמור לבינה מלאכותית בחודשים מאי עד אוגוסט 2026.
עדכוני אוגוסט 2026: אחסון, סביבות הרצה ו-Cloud Run
בתחום האחסון, שירות Filestore של Google Cloud קיבל שכבת אחסון אחורית (backend) חדשה שנבנתה ישירות על גבי Colossus, מערכת האחסון המבוזרת של גוגל. השכבה החדשה מאפשרת להקצות ביצועי IOPS בנפרד מנפח האחסון ומשתלבת עם GKE, ובסביבות AI עשויה לסייע לשרת קבוצות גדולות של סוכנים (agentic swarms) הקוראות וכותבות לאותו מאגר נתונים ללא ירידה בביצועים.
בנוסף, הוצגו סביבות בידוד מסוג gVisor בתוך אשכולות Ray מבוזרים על גבי GKE, בשיתוף פעולה עם Anyscale. מדובר בספרייה ניסיונית המשלבת את קרנל היישומים בקוד פתוח של גוגל, ומספקת בידוד חזק יותר ממכולות רגילות לצד זמני הפעלה מהירים ותקורה נמוכה של זיכרון. כמו כן, הושקו מופעי Cloud Run חדשים (Dedicated singleton compute runtimes) המיועדים להרצת סוכני AI אישיים ואינם נכבים כאשר הסוכן במצב חוסר פעילות. לפי הפרסום, עלות הרצת מופע כזה עם 1 vCPU וזיכרון של 1 GiB ברציפות למשך 30 יום עומדת על 5.70 דולר.
מדריכי יישום ופרוטוקול MCP באוגוסט 2026
במדריכים הטכניים צוין עדכון למפרט Model Context Protocol (MCP) מתאריך 2026-07-28, שבו ליבת הפרוטוקול הפכה לחסרת מצב (stateless). לחיצת היד (handshake) בוטלה, ותהליך האתחול המוגדר ב-SEP-2575 לצד כותרת Mcp-Session-Id המוגדרת ב-SEP-2567 הוסרו, כך שכל בקשה מתוארת באופן עצמאי.
מדריך נוסף עוסק בניהול עומסים בזמן אמת עבור סוכני AI ומערכות קוליות, המנהלות זרם דו-כיווני רציף של מקטעי אודיו, תמלולים, פלטי מודלים ודיבור מסונתז, ונדרשות לעדכן הקשר או להפעיל כלים מבלי לנתק את החיבור. מדריכים נוספים הציגו ארכיטקטורה לפלטפורמת היסק LLM אלסטית ב-GKE המשלבת את Capacity Advisor ו-Compute Advisor עם RunAI:model streamer או GCPFuse; הנחיות לעדכון שרתי GPU ו-TPU ללא נדידה חיה (live migration); יצירת תבניות Advanced Compute Images (ACIs) באמצעות ה-CLI, הקונסולה או Slurm; ושלוש דרכים לניהול קיבולת דינמי ב-Google Cloud: תזמון קיבולת להשבתה מתוכננת, החזקת גיבוי אוטומטי להשבתה לא מתוכננת, ושימוש ביכולות התזמור של GKE.
בקרב הלקוחות באוגוסט: UiPath עברה לצי משותף של מעבדי GPU בענן גוגל הכולל מופעי A3 עם שבבי NVIDIA H100 לאימון ומופעי G4 עם שבבי NVIDIA RTX PRO 6000 Blackwell Server Edition להיסק; מעבדת Mirendil עושה שימוש ב-AI Hypercomputer עם מעבדי TPU ו-GPU; חברת Replenit בנתה מנוע החלטות באמצעות BigQuery, פלטפורמת Gemini Enterprise Agent ומודלי Gemma בקוד פתוח על גבי Cloud TPUs, ודיווחה כי השילוב האחרון סיפק לה עלויות צינור עיבוד (pipeline) נמוכות ב-90% לעומת ספק הענן הקודם שלה; ו-Malachyte ביססה פלטפורמת המלצות למסחר על גבי Bigtable, שירות מנוהל ל-Kafka, Pub/Sub, Compute Engine ו-GKE.
עדכוני יולי 2026: Lustre, מכונות C4N ואבטחת שרשרת אספקה
ביולי 2026 הפך שירות Google Cloud Managed Lustre לזמין כללית (GA) בארבע רמות ביצועים המספקות קצב העברה של 125, 250, 500 ו-1000 מגה-בייט לשנייה לכל TiB נפח, עם יכולת הרחבה עד 8 פטה-בייט אחסון, בהתבסס על DDN EXAScaler. כמו כן, הושקו מכונות וירטואליות C4N המבוססות על מעבדי Intel Xeon דור 5 וחומרת פריקת עומסים Titanium, ומספקות רוחב פס רשת של 400 Gbps, קצב של 95 מיליון חבילות לשנייה (MPPS) ותפוקת אחסון בלוקים של עד 25 GiB/s בשילוב עם Hyperdisk Extreme.
חידושים נוספים ביולי כוללים תמיכה של GKE Dataplane V2 בעד 15,000 צמתים עם אכיפת מדיניות רשת פעילה, תכונת Co-operative time-slicing בכלי llm-d המאפשרת להעלות את ניצולת המאיצים מרמת בסיס של כ-40% עד ל-70% בעומסי למידת חיזוק (RL), וכלי האבטחה בקוד פתוח k8s-aibom שמנטר צבירי מכולות, מזהה סביבות AI כמו vLLM ו-Triton ומייצר קובצי ML-BOM בפורמט CycloneDX.
במדריכי יולי נכללו: תמיכת Day 0 במודל Kimi K3 של Moonshot AI בעל 2.8 טריליון פרמטרים; שימוש ב-GKE DRANET עם GPU ו-TPU במודל Gemma 4; הרצת Ray על גבי TPU; חבילת מיקרו-בנצ'מרק להערכת ביצועי TPU; ואופטימיזציה של מודל Mistral 3 Large MoE על גבי Ironwood (TPU v7x) שהשיגה שיפור ביצועים של פי 1.5 ועלייה של עד 48% בתפוקה. כמו כן, דווח כי גוגל דורגה כמובילה ב-Gartner Magic Quadrant לתשתיות AI, וסקר בקרב מעל 1,400 מובילי IT מצא כי 83% מהארגונים נדרשים לשדרג תשתיות כדי לתמוך ביישומי Agentic AI בסביבת ייצור.
עדכוני יוני ומאי 2026: מחשוב חסוי, שער היסק ו-Cloud Storage Rapid
ביוני 2026 הושקו יכולות Confidential Computing להגנה קריפטוגרפית על נתונים בשימוש בסביבות TEE עבור מכונות G4 עם שבבי Blackwell; הושק פורטל המפתחים TPU Developer Hub; ונוסף סוכן איסוף טלמטריה מבוסס OpenTelemetry למעבדי TPU. לפי דוח בנצ'מרק בלתי תלוי, GKE Inference Gateway השיג תפוקה גבוהה ב-15.7%, זמני המתנה קצרים ב-92.8% והשהיית inter-token נמוכה ב-62.6% לעומת שירות ה-Kubernetes המנוהל המוביל הבא, הודות לשימוש ב-prefix caching לשמירת מצבי KV cache של פרומפטים חוזרים. כמו כן הוצגו מדריכים לחיבור סוכנים לנתונים לא מובנים ב-Cloud Storage באמצעות MCP ופתרונות לאתגר ה-cold start באמצעות Run:ai Model Streamer, לצד סיפורי לקוח של Pager Health ו-Trustpilot.
במאי 2026 הוכרזה זמינות כללית (GA) של GKE Agent Sandbox, הושק פרויקט הקוד הפתוח Agent Substrate לדחיסת תשתיות סוכנים, ונוספה תמיכה בהערכת מודלי שפה על גבי מכשירים ב-Google AI Edge Portal. כמו כן הוצגה משפחת האחסון Cloud Storage Rapid הכוללת את Rapid Bucket ואת Rapid Cache, ופורסמו סקירות ארכיטקטורה על שדרוגי הרשת של גוגל ומודל אמינות ברמת אשכול עבור פיתוח מודלי חזית על מעבדי TPU, לצד שימוש של חברת Imgix ב-AI Hypercomputer עם מופעי G4 להגשת מעל 8 מיליארד תמונות וסרטונים.