גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4
מוצר חדש

גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4

מודל ה-MoE הניסיוני החדש של גוגל מאפשר לייצר בלוקים שלמים של טקסט במקביל ולשנות את כללי המשחק של ה-AI המקומי

4 דקות קריאה
מבוסס על כתבה שלDeepMindתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • מודל DiffusionGemma מציע מהירות עיבוד של מעל 1,000 אסימונים בשנייה על גבי מעבד גרפי NVIDIA H100.

  • ארכיטקטורת MoE של 26 מיליארד פרמטרים המפעילה רק 3.8 מיליארד פרמטרים במהלך ההסקה בפועל.

  • עיבוד מקבילי של בלוקים של 256 אסימונים בכל מעבר, המייתר את הצורך ביצירת טקסט איטית מילה אחר מילה.

  • פתרון אידיאלי לארגונים בישראל המעוניינים להריץ AI מקומי ומאובטח התואם את חוק הגנת הפרטיות.

גוגל מציגה את DiffusionGemma: טכנולוגיית דיפוזיית טקסט מהירה פי 4

  • מודל DiffusionGemma מציע מהירות עיבוד של מעל 1,000 אסימונים בשנייה על גבי מעבד גרפי NVIDIA...
  • ארכיטקטורת MoE של 26 מיליארד פרמטרים המפעילה רק 3.8 מיליארד פרמטרים במהלך ההסקה בפועל.
  • עיבוד מקבילי של בלוקים של 256 אסימונים בכל מעבר, המייתר את הצורך ביצירת טקסט איטית...
  • פתרון אידיאלי לארגונים בישראל המעוניינים להריץ AI מקומי ומאובטח התואם את חוק הגנת הפרטיות.

פריצת דרך במהירות: כיצד טכנולוגיית דיפוזיית טקסט משנה את חוקי המשחק

גוגל (Google) השיקה רשמית את DiffusionGemma, מודל קוד פתוח ניסיוני המבוסס על טכנולוגיית דיפוזיית טקסט, המציע מהירות יצירת טקסט מהירה עד פי 4 בהשוואה למודלים מסורתיים על גבי מעבדים גרפיים (GPUs). המודל פועל בארכיטקטורת Mixture of Experts (MoE) עם 26 מיליארד פרמטרים, ומאפשר עיבוד מקבילי של בלוקים שלמים של טקסט במקום כתיבה איטרטיבית תו אחר תו.

מה זה טכנולוגיית דיפוזיית טקסט?

טכנולוגיית דיפוזיית טקסט היא גישה חדשה לייצור שפה טבעית, השואבת השראה ממחוללי תמונות מבוססי דיפוזיה (כמו Stable Diffusion או Midjourney). בהקשר עסקי, במקום לכתוב טקסט מילה אחר מילה בצורה רגרסיבית-עצמית (Autoregressive), המודל מתחיל מ"קנבס" של אסימונים (tokens) אקראיים לחלוטין ומבצע סדרת מקצים של זיקוק, שכתוב ותיקון בו-זמנית על כל הבלוק הטקסטואלי. לדוגמה, יצירת פסקת קוד שלמה, עריכת טקסט בתוך שורות (In-line editing) או פתרון בעיות לוגיות מורכבות בזמן אמת. על פי נתוני חברת Google DeepMind, גישה זו מאפשרת לעבד 256 אסימונים במקביל בכל מעבר קדימה (forward pass) של הרשת הנוירונית, מה שמביא לחיסכון בזמן העיבוד.

הנתונים מאחורי DiffusionGemma: מהירות חסרת תקדים ללא צווארי בקבוק בחומרה

על פי הנתונים שפורסמו בבלוג הטכנולוגי הרשמי של גוגל, מודל DiffusionGemma מסוגל להפיק מעל 1,000 אסימונים (tokens) בשנייה על גבי מעבד גרפי ארגוני יחיד מסוג NVIDIA H100, וכ-700 אסימונים בשנייה על כרטיסי מסך צרכניים חזקים כמו NVIDIA GeForce RTX 5090. הביצועים המהירים הללו מושגים הודות להעתקת צוואר הבקבוק החישובי מרוחב הפס של הזיכרון (Memory-bandwidth) אל כוח העיבוד של המעבד (Compute). השינוי הארכיטקטוני הזה מאפשר לנצל את החומרה המקומית במלואה – המודל פועל כמו מכבש דפוס ענק המדפיס עמוד שלם בבת אחת, בניגוד למכונת כתיבה מסורתית הפועלת תו אחר תו וממתינה בכל שלב לחומרה. פריצת דרך זו עשויה לייעל את הפעילות של סוכני AI לעסקים הפועלים באופן מקומי על חומרת הקצה ללא תלות בחיבור אינטרנט חיצוני.

החברה מדווחת כי המודל שוחרר תחת רישיון קוד פתוח מתירני (Apache 2.0) והוא מבוסס על סדרת מודלי Gemma 4 ומחקרים מתקדמים של Gemini Diffusion. הארכיטקטורה של המודל משלבת מודל תערובת מומחים (Mixture of Experts - MoE) בנפח כולל של 26 מיליארד פרמטרים, כאשר בפועל רק 3.8 מיליארד פרמטרים מופעלים בכל שלב של הסקה (inference). מבנה חכם זה מאפשר למודל לרוץ ביעילות מרבית גם על חומרת קצה וכרטיסי מסך צרכניים עם זיכרון וידאו (VRAM) של 18 ג'יגה-בייט ומעלה לאחר תהליך קוונטיזציה (מזעור ודחיסת מודלים). גוגל מדגישה כי בעוד שמודלים אלו אינם מיועדים להחליף את האיכות הגבוהה של מודלי Gemma 4 הרגילים במשימות של כתיבה יצירתית ארוכה, הם מהווים מענה מהיר למשימות הדורשות משוב מיידי ואינטראקטיביות גבוהה.

ההקשר הרחב: מדוע הדיפוזיה כובשת את עולם הבלשנות החישובית?

המעבר ממודלים אוטו-רגרסיביים (Autoregressive) למודלים מבוססי דיפוזיה מייצג שינוי תפיסתי עמוק בעולם הבינה המלאכותית היוצרת. על פי ניתוחים של גורמים מובילים בתעשייה, חברות רבות מתמודדות כיום עם עלויות שרתים גבוהות ועם קושי להשיג חוויית משתמש חלקה בעוזרי AI הפועלים בזמן אמת. טכנולוגיית דיפוזיית טקסט פותרת את בעיית ה'לייטנסי' (זמן השהיה) המקומית באופן אלגנטי, בכך שהיא מאפשרת למעבדים גרפיים ייעודיים לפעול בשיא הקיבולת חישוב שלהם, ללא זמני המתנה פסיביים בין הפקת מילה אחת לבאה אחריה.

ההשלכות לעסקים בישראל ועלייה ברמת אבטחת המידע

עבור עסקים בישראל, ובמיוחד חברות טכנולוגיה, סוכנויות דיגיטל ומפתחי אפליקציות, הטכנולוגיה החדשה פותחת הזדמנויות עסקיות חדשות. מדובר ביתרון בולט במיוחד עבור מגזרים הרגישים לפרטיות מידע ופועלים תחת רגולציה קפדנית, כגון משרדי עורכי דין, קליניקות רפואיות פרטיות, חברות ביטוח וסוכנויות פיננסיות בישראל. לפי חוק הגנת הפרטיות הישראלי, שמירת מידע אישי ורגיש של לקוחות בעננים ציבוריים בינלאומיים כרוכה במגבלות משפטיות מחמירות וברמות סיכון גבוהות של דליפת מידע.

השימוש במודל מקומי, מהיר ומאובטח כמו DiffusionGemma מאפשר לארגונים ישראליים להריץ יישומי בינה מלאכותית מורכבים – כגון ניתוח מסמכים משפטיים, סיכום אוטומטי של שיחות טיפוליות או כתיבת קוד – ישירות על גבי שרתים מקומיים או מחשבי קצה מאובטחים בתוך משרדי הארגון. פעולה זו מתבצעת ללא צורך בהוצאת נתונים מחוץ לגבולות המדינה או לענן של חברות צד שלישי. בנוסף, חברות המפתחות פתרונות של אוטומציה עסקית יוכלו לשלב את המודל במערכות שירות לקוחות מקומיות הדורשות מענה מהיר במיוחד ובזמן אמת, ללא עלויות ריצה שוטפות וגבוהות של ספקי ענן בינלאומיים.

מה לעשות עכשיו: מדריך שלבים ליישום ראשוני בארגון שלכם

אם אתם מעוניינים לבחון את שילוב הטכנולוגיה בארגון שלכם, מומלץ לפעול לפי הצעדים הבאים:

  1. הערכת צורכי חומרה מקומיים: בדקו את מפרט המחשוב בארגון. כדי להריץ את המודל באופן מקומי לאחר קוונטיזציה (צמצום משקלים ל-4-bit או NVFP4), תזדקקו לכרטיס מסך ייעודי של NVIDIA (כמו RTX 4090 או RTX 5090 החדש) עם לפחות 18GB VRAM פנוי.
  2. הורדת משקולות המודל ועבודה עם כלי פיתוח: הורידו את משקולות המודל הרשמיות ישירות מפלטפורמת Hugging Face, שבה גוגל שחררה את המודל תחת רישיון Apache 2.0 המתירני. תוכלו להריץ אותו באמצעות ספריות קוד פתוח פופולריות כמו vLLM (בתמיכת Red Hat), MLX (עבור מעבדי אפל) או Hugging Face Transformers.
  3. ביצוע התאמה אישית (Fine-tuning): במשימות ספציפיות שאינן ליניאריות (כמו פתרון בעיות לוגיות מורכבות, בניית מבני נתונים או פורמטים קשיחים של קוד), השתמשו בכלים מותאמים כמו Unsloth או Hackable Diffusion כדי לאמן את המודל על דאטה-סט ארגוני ייחודי שלכם.
  4. בניית תהליכי עבודה מקומיים: שלבו את המודל במערכות ה-CRM או הכלים הפנימיים שלכם באמצעות כלי אינטגרציה גמישים כמו N8N המאפשרים הרצה מקומית מאובטחת ועבודה עם API מקומי.

מבט קדימה: העתיד של עיבוד שפה מקומי

ההשקה הניסיונית של מודל DiffusionGemma מסמנת את תחילתו של עידן חדש שבו המהירות והאינטנסיביות של בינה מלאכותית מקומית אינן נופלות, ואף עולות, על אלו של שירותי הענן המובילים במקרי קצה מסוימים. עסקים שישכילו לאמץ פתרונות אלו כבר עכשיו ייהנו מיתרון תחרותי עצום במהירות התגובה, בפרטיות ובאבטחת המידע שלהם. שילוב של מודלים מהירים אלו עם פלטפורמות מתקדמות כגון סוכני AI, בוט וואטסאפ עסקי ומערכות CRM חכמות, יאפשר לעסקים ישראליים להציע חוויית לקוח מיידית ומאובטח לחלוטין.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של DeepMind. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב
חדשות
3 דקות
מ־DeepMind

גוגל משקיעה 40 מיליון דולר במשימת ג'נסיס הלאומית של ארה"ב

בבלוג הרשמי של גוגל קלאוד הוכרז על הרחבת התמיכה של החברה במשימת ג'נסיס (Genesis Mission) הלאומית של ארצות הברית, באמצעות הקצאה של 40 מיליון דולר באסימוני בינה מלאכותית ובקרדיטים לענן. גוגל תעניק למעבדות הלאומיות של משרד האנרגיה האמריקאי (DOE) גישה לכלי בינה מלאכותית מתקדמים מבית Google DeepMind, בהם AlphaEvolve, AlphaFold 3 ו-AlphaGenome, לצד רישיונות שימוש ב-Gemini for Government למשך שנה עבור עשרות אלפי עובדים. הכלים כבר משולבים במעבדות כגון PNNL ו-NLR, ומסייעים בקיצור זמני כיול חומרה ובמיפוי מערכות מתמטיות מורכבות.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
העצמת דור העתיד של הממציאים בהודו באמצעות ATL Saathi
חדשות
4 דקות
מ־DeepMind

העצמת דור העתיד של הממציאים בהודו באמצעות ATL Saathi

גוגל דיפמיינד וארגון Atal Innovation Mission (AIM) הכריזו על השקת פיילוט חי של ATL Saathi – אפליקציית רשת המופעלת על ידי מודל Gemini, המשמשת כעוזרת תכנון והכשרה אישית הזמינה 24/7 עבור מורים ומחנכים במעבדות Atal Tinkering Labs (ATL) ברחבי הודו. היוזמה, המיושמת בשלב ראשון ב-100 בתי ספר, נועדה להקל על העומס המנהלי של המורים, לייצר עבורם רעיונות לפרויקטים מותאמי-גיל ולימודים, ולספק הוראות הרכבה ודיאגרמות חיווט מדויקות לניסויים.

קרא עוד
יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים
מוצר חדש
4 דקות
מ־DeepMind

יצירת תמונות ווידאו באמצעות API לעסקים: גוגל משיקה מודלים חדשים

חברת Google DeepMind (חטיבת הבינה המלאכותית של גוגל) השיקה שני מודלים חדשים למפתחים: Nano Banana 2 Lite ליצירת תמונות מהירה במיוחד ו-Gemini Omni Flash ליצירת וידאו ועריכה שיחתית. לפי הנתונים הרשמיים, Nano Banana 2 Lite מייצר תמונות בתוך 4 שניות בלבד בעלות של 0.034 דולר ל-1,000 תמונות, ומחליף את מודל הדור הקודם gemini-2.5-flash-image. במקביל, Gemini Omni Flash מאפשר יצירת סרטוני וידאו של עד 10 שניות בעלות תחרותית של 0.10 דולר לשנייה. שני המודלים זמינים כעת ב-Google AI Studio ובממשק ה-Gemini API, ומאפשרים לעסקים למכור ולייצר תוכן ויזואלי אינטראקטיבי ואוטומטי בקנה מידה רחב.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI
מוצר חדש
3 דקות
מ־TechCrunch

AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI

לפי דיווח של TechCrunch, חברת השבבים AMD משיקה את מערכת ה-Helios, מערכת שרתים שלמה במסד (rack-scale system) המיועדת להתחרות ישירות במובילת השוק Nvidia. המערכת החדשה, שתוכננה עבור מעבדות ה-AI הגדולות בעולם כדי לאמן ולהריץ את מודלי הקצה התובעניים ביותר, כבר גייסה רשימה של לקוחות ענק הכוללת את מיקרוסופט, OpenAI, Meta, Oracle ו-Anthropic. מיקרוסופט מתכננת להרחיב את תשתית הענן Azure באמצעותה, ואילו Anthropic הכריזה על שיתוף פעולה לפריסת עד שני גיגוואט של מעבדים גרפיים. בנוסף, AMD הציגה את מעבד ה-Venice-X המיועד למרכזי נתונים שיושק ב-2027. מנכ"לית AMD, ד"ר ליסה סו, מעריכה כי העלייה בביקוש למחשוב המונעת על ידי בינה מלאכותית סוכנתית (agentic AI) תוביל את שוק מאיצי ה-AI לשווי של כ-1.4 טריליון דולר עד שנת 2030.

קרא עוד
Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית
מוצר חדש
4 דקות
מ־TechCrunch

Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית

חברת הסטארט-אפ Runway משיקה את Runway Media Router, כלי חדש המאפשר למפתחים לנתב באופן אוטומטי בקשות יצירת תמונה, וידאו ואודיו למודל המתאים ביותר. הכלי, שהושק באמצעות פלטפורמת המפתחים Runway Dev, מנתב את הבקשות על פי העדפות המפתח לגבי איכות, מהירות או עלות. המהלך מסמן את שאיפתה של Runway להפוך לשכבת תשתית ואורקסטרציה עבור תעשיית המדיה הגנרטיבית, בתקופה שבה השוק נעשה צפוף ותחרותי במיוחד והחברה מתמודדת עם תחרות עזה מצד ענקיות טכנולוגיה כמו גוגל, בייטדאנס ועליבאבא.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי
מוצר חדש
4 דקות
מ־TechCrunch

OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי

לפי דיווח ב-TechCrunch, חברת OpenAI נכנסת לשוק החומרה עם השקת מקלדת ה-Codex Micro במחיר של 230 דולר, המיועדת לניהול סוכני תכנות חצי-אוטונומיים. המקלדת פותחה בשיתוף עם Work Louder וכוללת מקשים מוארים להצגת סטטוס, ג'ויסטיק וחוגה לכיוונון רמת החשיבה של הסוכן. במקביל, דיווח של Bloomberg חשף כי החברה מפתחת רמקול חכם נייד ונטול מסך בעל חלקים נעים, המעוצב על ידי מהנדסי Apple לשעבר. פיתוח זה עומד במרכז תביעה שהגישה Apple נגד OpenAI בשבוע שעבר בטענה לגניבת סודות מסחריים, טענות ש-OpenAI מכחישה לחלוטין.

קרא עוד