גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4
מוצר חדש

גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4

מודל ה-MoE הניסיוני החדש של גוגל מאפשר לייצר בלוקים שלמים של טקסט במקביל ולשנות את כללי המשחק של ה-AI המקומי

4 דקות קריאה
מבוסס על כתבה שלDeepMindתרגום וסיכום באמצעות מערכת חדשות בליווי AIאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • מודל DiffusionGemma מציע מהירות עיבוד של מעל 1,000 אסימונים בשנייה על גבי מעבד גרפי NVIDIA H100.

  • ארכיטקטורת MoE של 26 מיליארד פרמטרים המפעילה רק 3.8 מיליארד פרמטרים במהלך ההסקה בפועל.

  • עיבוד מקבילי של בלוקים של 256 אסימונים בכל מעבר, המייתר את הצורך ביצירת טקסט איטית מילה אחר מילה.

  • פתרון אידיאלי לארגונים בישראל המעוניינים להריץ AI מקומי ומאובטח התואם את חוק הגנת הפרטיות.

גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4

  • מודל DiffusionGemma מציע מהירות עיבוד של מעל 1,000 אסימונים בשנייה על גבי מעבד גרפי NVIDIA...
  • ארכיטקטורת MoE של 26 מיליארד פרמטרים המפעילה רק 3.8 מיליארד פרמטרים במהלך ההסקה בפועל.
  • עיבוד מקבילי של בלוקים של 256 אסימונים בכל מעבר, המייתר את הצורך ביצירת טקסט איטית...
  • פתרון אידיאלי לארגונים בישראל המעוניינים להריץ AI מקומי ומאובטח התואם את חוק הגנת הפרטיות.

פריצת דרך במהירות: כיצד טכנולוגיית דיפוזיית טקסט משנה את חוקי המשחק

גוגל (Google) השיקה רשמית את DiffusionGemma, מודל קוד פתוח ניסיוני המבוסס על טכנולוגיית דיפוזיית טקסט, המציע מהירות יצירת טקסט מהירה עד פי 4 בהשוואה למודלים מסורתיים על גבי מעבדים גרפיים (GPUs). המודל פועל בארכיטקטורת Mixture of Experts (MoE) עם 26 מיליארד פרמטרים, ומאפשר עיבוד מקבילי של בלוקים שלמים של טקסט במקום כתיבה איטרטיבית תו אחר תו.

מה זה טכנולוגיית דיפוזיית טקסט?

טכנולוגיית דיפוזיית טקסט היא גישה חדשה לייצור שפה טבעית, השואבת השראה ממחוללי תמונות מבוססי דיפוזיה (כמו Stable Diffusion או Midjourney). בהקשר עסקי, במקום לכתוב טקסט מילה אחר מילה בצורה רגרסיבית-עצמית (Autoregressive), המודל מתחיל מ"קנבס" של אסימונים (tokens) אקראיים לחלוטין ומבצע סדרת מקצים של זיקוק, שכתוב ותיקון בו-זמנית על כל הבלוק הטקסטואלי. לדוגמה, יצירת פסקת קוד שלמה, עריכת טקסט בתוך שורות (In-line editing) או פתרון בעיות לוגיות מורכבות בזמן אמת. על פי נתוני חברת Google DeepMind, גישה זו מאפשרת לעבד 256 אסימונים במקביל בכל מעבר קדימה (forward pass) של הרשת הנוירונית, מה שמביא לחיסכון בזמן העיבוד.

הנתונים מאחורי DiffusionGemma: מהירות חסרת תקדים ללא צווארי בקבוק בחומרה

על פי הנתונים שפורסמו בבלוג הטכנולוגי הרשמי של גוגל, מודל DiffusionGemma מסוגל להפיק מעל 1,000 אסימונים (tokens) בשנייה על גבי מעבד גרפי ארגוני יחיד מסוג NVIDIA H100, וכ-700 אסימונים בשנייה על כרטיסי מסך צרכניים חזקים כמו NVIDIA GeForce RTX 5090. הביצועים המהירים הללו מושגים הודות להעתקת צוואר הבקבוק החישובי מרוחב הפס של הזיכרון (Memory-bandwidth) אל כוח העיבוד של המעבד (Compute). השינוי הארכיטקטוני הזה מאפשר לנצל את החומרה המקומית במלואה – המודל פועל כמו מכבש דפוס ענק המדפיס עמוד שלם בבת אחת, בניגוד למכונת כתיבה מסורתית הפועלת תו אחר תו וממתינה בכל שלב לחומרה. פריצת דרך זו עשויה לייעל את הפעילות של סוכני AI לעסקים הפועלים באופן מקומי על חומרת הקצה ללא תלות בחיבור אינטרנט חיצוני.

החברה מדווחת כי המודל שוחרר תחת רישיון קוד פתוח מתירני (Apache 2.0) והוא מבוסס על סדרת מודלי Gemma 4 ומחקרים מתקדמים של Gemini Diffusion. הארכיטקטורה של המודל משלבת מודל תערובת מומחים (Mixture of Experts - MoE) בנפח כולל של 26 מיליארד פרמטרים, כאשר בפועל רק 3.8 מיליארד פרמטרים מופעלים בכל שלב של הסקה (inference). מבנה חכם זה מאפשר למודל לרוץ ביעילות מרבית גם על חומרת קצה וכרטיסי מסך צרכניים עם זיכרון וידאו (VRAM) של 18 ג'יגה-בייט ומעלה לאחר תהליך קוונטיזציה (מזעור ודחיסת מודלים). גוגל מדגישה כי בעוד שמודלים אלו אינם מיועדים להחליף את האיכות הגבוהה של מודלי Gemma 4 הרגילים במשימות של כתיבה יצירתית ארוכה, הם מהווים מענה מהיר למשימות הדורשות משוב מיידי ואינטראקטיביות גבוהה.

ההקשר הרחב: מדוע הדיפוזיה כובשת את עולם הבלשנות החישובית?

המעבר ממודלים אוטו-רגרסיביים (Autoregressive) למודלים מבוססי דיפוזיה מייצג שינוי תפיסתי עמוק בעולם הבינה המלאכותית היוצרת. על פי ניתוחים של גורמים מובילים בתעשייה, חברות רבות מתמודדות כיום עם עלויות שרתים גבוהות ועם קושי להשיג חוויית משתמש חלקה בעוזרי AI הפועלים בזמן אמת. טכנולוגיית דיפוזיית טקסט פותרת את בעיית ה'לייטנסי' (זמן השהיה) המקומית באופן אלגנטי, בכך שהיא מאפשרת למעבדים גרפיים ייעודיים לפעול בשיא הקיבולת חישוב שלהם, ללא זמני המתנה פסיביים בין הפקת מילה אחת לבאה אחריה.

ההשלכות לעסקים בישראל ועלייה ברמת אבטחת המידע

עבור עסקים בישראל, ובמיוחד חברות טכנולוגיה, סוכנויות דיגיטל ומפתחי אפליקציות, הטכנולוגיה החדשה פותחת הזדמנויות עסקיות חדשות. מדובר ביתרון בולט במיוחד עבור מגזרים הרגישים לפרטיות מידע ופועלים תחת רגולציה קפדנית, כגון משרדי עורכי דין, קליניקות רפואיות פרטיות, חברות ביטוח וסוכנויות פיננסיות בישראל. לפי חוק הגנת הפרטיות הישראלי, שמירת מידע אישי ורגיש של לקוחות בעננים ציבוריים בינלאומיים כרוכה במגבלות משפטיות מחמירות וברמות סיכון גבוהות של דליפת מידע.

השימוש במודל מקומי, מהיר ומאובטח כמו DiffusionGemma מאפשר לארגונים ישראליים להריץ יישומי בינה מלאכותית מורכבים – כגון ניתוח מסמכים משפטיים, סיכום אוטומטי של שיחות טיפוליות או כתיבת קוד – ישירות על גבי שרתים מקומיים או מחשבי קצה מאובטחים בתוך משרדי הארגון. פעולה זו מתבצעת ללא צורך בהוצאת נתונים מחוץ לגבולות המדינה או לענן של חברות צד שלישי. בנוסף, חברות המפתחות פתרונות של אוטומציה עסקית יוכלו לשלב את המודל במערכות שירות לקוחות מקומיות הדורשות מענה מהיר במיוחד ובזמן אמת, ללא עלויות ריצה שוטפות וגבוהות של ספקי ענן בינלאומיים.

מה לעשות עכשיו: מדריך שלבים ליישום ראשוני בארגון שלכם

אם אתם מעוניינים לבחון את שילוב הטכנולוגיה בארגון שלכם, מומלץ לפעול לפי הצעדים הבאים:

  1. הערכת צורכי חומרה מקומיים: בדקו את מפרט המחשוב בארגון. כדי להריץ את המודל באופן מקומי לאחר קוונטיזציה (צמצום משקלים ל-4-bit או NVFP4), תזדקקו לכרטיס מסך ייעודי של NVIDIA (כמו RTX 4090 או RTX 5090 החדש) עם לפחות 18GB VRAM פנוי.
  2. הורדת משקולות המודל ועבודה עם כלי פיתוח: הורידו את משקולות המודל הרשמיות ישירות מפלטפורמת Hugging Face, שבה גוגל שחררה את המודל תחת רישיון Apache 2.0 המתירני. תוכלו להריץ אותו באמצעות ספריות קוד פתוח פופולריות כמו vLLM (בתמיכת Red Hat), MLX (עבור מעבדי אפל) או Hugging Face Transformers.
  3. ביצוע התאמה אישית (Fine-tuning): במשימות ספציפיות שאינן ליניאריות (כמו פתרון בעיות לוגיות מורכבות, בניית מבני נתונים או פורמטים קשיחים של קוד), השתמשו בכלים מותאמים כמו Unsloth או Hackable Diffusion כדי לאמן את המודל על דאטה-סט ארגוני ייחודי שלכם.
  4. בניית תהליכי עבודה מקומיים: שלבו את המודל במערכות ה-CRM או הכלים הפנימיים שלכם באמצעות כלי אינטגרציה גמישים כמו N8N המאפשרים הרצה מקומית מאובטחת ועבודה עם API מקומי.

מבט קדימה: העתיד של עיבוד שפה מקומי

ההשקה הניסיונית של מודל DiffusionGemma מסמנת את תחילתו של עידן חדש שבו המהירות והאינטנסיביות של בינה מלאכותית מקומית אינן נופלות, ואף עולות, על אלו של שירותי הענן המובילים במקרי קצה מסוימים. עסקים שישכילו לאמץ פתרונות אלו כבר עכשיו ייהנו מיתרון תחרותי עצום במהירות התגובה, בפרטיות ובאבטחת המידע שלהם. שילוב של מודלים מהירים אלו עם פלטפורמות מתקדמות כגון סוכני AI, בוט וואטסאפ עסקי ומערכות CRM חכמות, יאפשר לעסקים ישראליים להציע חוויית לקוח מיידית ומאובטח לחלוטין.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה באמצעות מערכת בליווי בינה מלאכותית לתרגום, סיכום ובקרות איכות אוטומטיות מתוך פרסום מקורי של DeepMind. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

קבלו עדכוני AI שימושיים למייל

תקציר ממוקד ממערכת החדשות שלנו.

גוגל משיקה את Gemini Robotics ER 2: מוח בינה מלאכותית לרובוטים
מוצר חדש
4 דקות
מ־DeepMind

גוגל משיקה את Gemini Robotics ER 2: מוח בינה מלאכותית לרובוטים

חברת גוגל הכריזה על השקת Gemini Robotics ER 2, מודל חשיבה מגולמת (embodied reasoning) מתקדם המשמש כ'מוח' ברמה גבוהה עבור רובוטים. המודל מאפשר תכנון משימות מרובות שלבים, תיאום כלים בזמן אמת, והבנת סביבה מבוססת וידאו רציף. הוא כולל שיפורים משמעותיים במעקב אחר התקדמות משימות (בדיוק של 57.4%) ואיתור רגעים קריטיים (בדיוק של 91.3%), וכן תומך בשיתוף פעולה בין מספר רובוטים שונים. המודל זמין כעת למפתחים דרך ה-Gemini API, Google AI Studio ובגרסת תצוגה מקדימה פרטית ב-Gemini Enterprise Agent Platform.

קרא עוד
גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב
חדשות
3 דקות
מ־DeepMind

גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב

בבלוג הרשמי של גוגל קלאוד הוכרז על הרחבת התמיכה של החברה במשימת ג'נסיס (Genesis Mission) הלאומית של ארצות הברית, באמצעות הקצאה של 40 מיליון דולר באסימוני בינה מלאכותית ובקרדיטים לענן. גוגל תעניק למעבדות הלאומיות של משרד האנרגיה האמריקאי (DOE) גישה לכלי בינה מלאכותית מתקדמים מבית Google DeepMind, בהם AlphaEvolve, AlphaFold 3 ו-AlphaGenome, לצד רישיונות שימוש ב-Gemini for Government למשך שנה עבור עשרות אלפי עובדים. הכלים כבר משולבים במעבדות כגון PNNL ו-NLR, ומסייעים בקיצור זמני כיול חומרה ובמיפוי מערכות מתמטיות מורכבות.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים
מוצר חדש
4 דקות
מ־DeepMind

יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים

חברת Google DeepMind (חטיבת הבינה המלאכותית של גוגל) השיקה שני מודלים חדשים למפתחים: Nano Banana 2 Lite ליצירת תמונות מהירה במיוחד ו-Gemini Omni Flash ליצירת וידאו ועריכה שיחתית. לפי הנתונים הרשמיים, Nano Banana 2 Lite מייצר תמונות בתוך 4 שניות בלבד בעלות של 0.034 דולר ל-1,000 תמונות, ומחליף את מודל הדור הקודם gemini-2.5-flash-image. במקביל, Gemini Omni Flash מאפשר יצירת סרטוני וידאו של עד 10 שניות בעלות תחרותית של 0.10 דולר לשנייה. שני המודלים זמינים כעת ב-Google AI Studio ובממשק ה-Gemini API, ומאפשרים לעסקים למכור ולייצר תוכן ויזואלי אינטראקטיבי ואוטומטי בקנה מידה רחב.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח
מוצר חדש
4 דקות
מ־Salesforce Blog

סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח

סיילספורס הציגה את Scheduling Agent במסגרת Agentforce Field Service, סוכן בינה מלאכותית הפועל 24/7 לתיאום, שינוי וביטול פגישות שירות שטח. הסוכן מחובר לנתוני הלקוחות, ללוחות הזמנים של הטכנאים ולמנוע האופטימיזציה של הארגון, ופועל בערוצי תקשורת מגוונים בהם וואטסאפ, דוא"ל, SMS, iMessage ושיחות קוליות. המערכת מבוססת על Agent Script לקבלת החלטות דטרמיניסטית ואכיפת כללים עסקיים ללא ניחושים של מודלי שפה, ומספקת מענה לפניות לקוחות, סדרנים, טכנאים וטריגרים מנכסים. המערכת תוצג בכנס Dreamforce וב-Salesforce+.

קרא עוד
אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow
מוצר חדש
4 דקות
מ־SiliconANGLE AI

אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow

חברת Experian משיקה את מערכת Agent OS ומעמיקה את פעילותה בתחום סוכני ה-AI באמצעות שותפות ראשונה עם ServiceNow. הפלטפורמה מאפשרת לשלב יכולות ניהול סיכונים, אימות וקבלת החלטות בתהליכי עבודה ארגוניים, תוך חיבור לפלטפורמת Ascend של אקספריאן. המערכת כוללת מנגנוני אבטחה מחמירים, שער בקרה על תעבורה, בדיקות אדברסריות ושמירה על מעורבות אנושית בהחלטות מפוקחות רגולטורית. הפתרון נגיש באמצעות ממשקי API ושרת MCP ומאפשר החלפת מודלים לפי עומס העבודה.

קרא עוד
שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון
מוצר חדש
4 דקות
מ־Salesforce Blog

שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון

לפי פרסום של צוות Agentforce מבית Salesforce, תזמור מרובה-סוכנים (Multi-agent orchestration) זמין כעת באופן כללי. הפרסום מציג שלושה סימנים לכך שסוכן AI בודד הגיע לקצה גבול היכולת שלו: הסוכן מנסה לבצע משימות רבות מדי וסובל מהתנגשות כוונות (Intent collision), הנתונים הנדרשים נמצאים מחוץ לגבולות ה-Salesforce org, או שצוותים שונים נדרשים לנהל חלקים שונים של הסוכן. המאמר מציג ארבעה נתיבי ארכיטקטורה ושאלות מוכנות לבחינת המעבר, ומציין כי בבדיקות פנימיות בעיות הסקה מתרחשות לרוב מעבר לשבעה תת-סוכנים.

קרא עוד
סיילספורס מציגה את פלטפורמת ה-CRM מבוססת הסוכנים שלה
מוצר חדש
4 דקות
מ־Salesforce Blog

סיילספורס מציגה את פלטפורמת ה-CRM מבוססת הסוכנים שלה

סיילספורס מציגה סקירה מקיפה על פלטפורמת ה-CRM מבוססת הסוכנים שלה (Agentic CRM), המשלבת סוכני בינה מלאכותית, עובדים ומערכות ארגוניות על גבי בסיס נתונים מאוחד. הפלטפורמה כוללת את ארכיטקטורת Headless 360, Data 360, פלטפורמת Agentforce, סביבת העבודה Slack ושכבת האמון Trust Layer לאבטחת מידע ללא שמירתו החיצונית. לפי נתוני סיילספורס, שילוב סוכני ה-AI במחלקות השירות, המכירות, השיווק, המסחר וה-IT מספק שיפורים תפעוליים והחזר השקעה ממוצע של 55%.

קרא עוד