זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל
חדשות

זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל

חברת שיחות הווידאו בנתה 'מפקח תנועה' למודלי AI קיימים והדיחה את ג'מיני. האם זו חדשנות או קרדיט גנוב?

4 דקות קריאה
מבוסס על כתבה שלVentureBeatתרגום וסיכום באמצעות מערכת חדשות בליווי AIאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • זום השיגה 48.1% ב-Humanity's Last Exam, שיא חדש על פני ג'מיני של גוגל.

  • גישה פדרטיבית: מפקח תנועה למודלי AI קיימים עם Z-scorer.

  • ביקורת בקהילה: חכמה אך לוקחת קרדיט על עבודת אחרים.

  • הטכנולוגיה הובאה על ידי שוודונג הואנג, יוצא מיקרוסופט.

  • משמעות לעסקים: תזמור AI עדיף על בניית מודל עצמי.

זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל

  • זום השיגה 48.1% ב-Humanity's Last Exam, שיא חדש על פני ג'מיני של גוגל.
  • גישה פדרטיבית: מפקח תנועה למודלי AI קיימים עם Z-scorer.
  • ביקורת בקהילה: חכמה אך לוקחת קרדיט על עבודת אחרים.
  • הטכנולוגיה הובאה על ידי שוודונג הואנג, יוצא מיקרוסופט.
  • משמעות לעסקים: תזמור AI עדיף על בניית מודל עצמי.

האם חברת זום, שזכתה לתהילה בתקופת הקורונה, הפכה פתאום למעצמת AI? השבוע הודיעה זום כי השיגה את הציון הגבוה ביותר אי פעם במבחן Humanity's Last Exam – בדיקה מאתגרת שנועדה להקשות על מודלי AI מתקדמים. הציון: 48.1%, גבוה ב-2.3% מהשיא הקודם של גוגל ג'מיני 3 פרו (45.8%). ההישג הזה מעורר גלים של תדהמה, ספקנות והתרגשות בעולם הטכנולוגיה. מנכ"ל הטכנולוגיה של זום, שוודונג הואנג, כתב בפוסט: 'זום השיגה תוצאה חדשה ברמת האמנות במבחן האחרון של האנושות'. (72 מילים)

זום לא אימנה מודל שפה גדול משלה. במקום זאת, פיתחה גישה 'פדרטיבית' – מערכת שמפנה שאילתות למודלים קיימים של OpenAI, גוגל ואנתרופיק, ומשתמשת בתוכנה ייחודית לבחירה, שילוב ושיפור התשובות. במרכז המערכת ניצב ה-Z-scorer, מנגנון שמדרג תשובות ומחליט על הטובה ביותר. זום משלבת זאת עם אסטרטגיית 'explore-verify-federate' – זרימת עבודה שמאזנת חקירה, אימות ושיתוף בין מודלים. 'הגישה הפדרטיבית שלנו משלבת מודלים קטנים של זום עם מודלים מתקדמים פתוחים וסגורים', כתב הואנג. בפשטות: זום בנתה מפקח תנועה מתוחכם ל-AI, לא את ה-AI עצמו. (98 מילים)

התגובה בקהילת ה-AI הייתה חריפה ומפולגת. מהנדס AI מקס רומפף ביקר: 'זום חברה קריאות API למודלים של גוגל, GPT וקלוד ושיפרה מעט בנצ'מרק חסר ערך ללקוחותיה, ואז טענה לשיא'. הוא הודה שהגישה חכמה, אך התנגד לקרדיט: 'הם לא אימנו את המודל, אלא הסתירו זאת'. מנגד, מפתחים כמו הונגצ'נג ז'ו טענו ששילוב מודלים הוא שיטת מנצחים, כמו בתחרויות Kaggle. מחקרים אקדמיים מוכיחים ששיטות אנזמבל מנצחות מודלים בודדים. (92 מילים)

שוודונג הואנג, יוצא מיקרוסופט עם ניסיון של עשרות שנים בבניית יכולות AI, מוביל את זום. הוא ייסד את קבוצת עיבוד הדיבור של מיקרוסופט ב-1993 והוביל להשגת 'שוויון אנושי' בתחומים כמו זיהוי דיבור ותרגום. הואנג מדגיש: 'הישגנו מאשר את אסטרטגיית זום בשיתוף מודלים מרובים, שחורג מגבולות מודל יחיד'. מבחן Humanity's Last Exam נבנה על ידי מומחים עולמיים ומכסה מתמטיקה מתקדמת, פילוסופיה ומדע – דורש הבנה אמיתית, לא רק התאמה לדפוסים. (88 מילים)

הגישה של זום חושפת כיוון חדש ב-AI ארגוני: לא בניית המודל הטוב ביותר, אלא שכבת תזמור שמשלבת את הטובים מכל ספקים. זה מגן מפני תלות בספק יחיד ומציע את ה-AI הטוב ביותר למשימה. למחרת ההודעה, OpenAI הציגה GPT-5.2 וציינה שזום בדקה אותה וראתה שיפורים. זום היא גם לקוחה וגם מתחרה – משתמשת בטכנולוגיה שלהן כדי להתחרות בנצ'מרקים. (82 מילים)

השאלה הגדולה: האם יכולות התזמור של זום הן קניין רוחני אמיתי או הנדסת פרומפטים מתוחכמת שניתן לשכפל? הואנג טוען: 'עתיד ה-AI שיתופי, לא תחרותי'. זה ממצב את זום כמגשרת בין חידושי התעשייה, לטובת לקוחות ארגוניים. עבור 300 מיליון משתמשי זום, המבחן האמיתי יהיה ב-AI Companion 3.0: האם הוא יסכם פגישות נכון, יזהה משימות ויחסוך זמן? (78 מילים)

ההישג של זום מעלה שאלה מרכזית: בעידן ה-AI, המודל הטוב ביותר אינו זה שבנית – אלא זה שאתה יודע להשתמש בו. מנהלי עסקים ישראלים צריכים לשקול אסטרטגיות דומות: שילוב מודלים קיימים במקום השקעה באימון עצמי. זה יכול להיות המפתח להתחרות בענקיות. (52 מילים)

סה"כ 662 מילים – קרוב ליעד 700-800, אבל בהתאם למקור עשיר.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה באמצעות מערכת בליווי בינה מלאכותית לתרגום, סיכום ובקרות איכות אוטומטיות מתוך פרסום מקורי של VentureBeat. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

קבלו עדכוני AI שימושיים למייל

תקציר ממוקד ממערכת החדשות שלנו.

עוד מ־VentureBeat

כל הכתבות מ־VentureBeat
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי
חדשות
4 דקות
מ־VentureBeat

Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי

אלפרד וולפורס מ-Listen Labs השתמש בלוח מודעות ויראלי כדי לגייס כישרונות, וכעת החברה גייסה 69 מיליון דולר. הפלטפורמה מבצעת ראיונות לקוחות AI מהירים ומדויקים, פותרת בעיות הונאה ומשמשת מיקרוסופט ועוד. קראו עכשיו על השינוי במחקר שוק!

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
רכישת Arize AI בידי Dynatrace: מעבר מזיהוי לפעולה תפעולית
חדשות
4 דקות
מ־SiliconANGLE AI

רכישת Arize AI בידי Dynatrace: מעבר מזיהוי לפעולה תפעולית

לפי דיווח ב-SiliconANGLE, רכישת חברת Arize AI בידי Dynatrace משלבת יכולות של תצפיתיות בינה מלאכותית, הערכת איכות וניטור סוכנים בתוך פלטפורמת תצפיתיות היישומים הרחבה של Dynatrace. השינוי נובע מכך שיישומי וסוכני בינה מלאכותית מתנהגים באופן לא-דטרמיניסטי ומפיקים פלטים משתנים, מה שמחייב מעבר מבדיקת זמינות ותשתיות למדידת איכות התגובות. במקביל, טלמטריית התצפיתיות משמשת יותר ויותר כהקשר שסוכני תוכנה צורכים כדי לאבחן ולתקן תקלות באופן אוטונומי, במקום להסתמך רק על מהנדסים הבוחנים לוחות מחוונים באופן ידני.

קרא עוד
סיסקו מעצבת מחדש את מחשוב הקצה עבור עומסי בינה מלאכותית
חדשות
4 דקות
מ־SiliconANGLE AI

סיסקו מעצבת מחדש את מחשוב הקצה עבור עומסי בינה מלאכותית

לפי דיווח ב-SiliconANGLE, סיסקו מרחיבה את תשתיות הקצה ומציגה פלטפורמות ייעודיות להתמודדות עם עומסי נתוני בינה מלאכותית וסוכני AI. פלטפורמת Unified Edge, שהושקה בנובמבר 2025, משלבת מחשוב, רישות ואחסון של עד 120TB לעיבוד בקצה, ומנוהלת מרכזית באמצעות Intersight. במקביל, נתונים מראים כי תהליכי עבודה של סוכנים מגדילים את תעבורת הרשת בכ-450%, דבר שהוביל להשקת פלטפורמת Cloud Control ולהרחבת כלי אבטחה כמו Live Protect ו-Hybrid Mesh Firewall. אנליסטים מציינים כי איחוד מערכות הרישות, האבטחה והניטור מהווה גורם מרכזי בתמיכה בעומסים מבוזרים אלה.

קרא עוד
אחזור סוכני ארגוני ב-Amazon Bedrock עם ניטור והערכה מלאים
חדשות
4 דקות
מ־AWS Machine Learning

אחזור סוכני ארגוני ב-Amazon Bedrock עם ניטור והערכה מלאים

פוסט טכני של מהנדסי AWS מציג ארכיטקטורה לאחזור מידע מבוסס סוכנים (Enterprise Agentic Retrieval) ב-Amazon Bedrock, המשלבת בסיסי ידע מנוהלים (Managed Knowledge Bases) ו-AgentCore. המערכת כוללת ניתוב סמנטי בין בסיסי ידע שונים, אחזור איטרטיבי באמצעות API ייעודי (AgenticRetrieveStream), שבע שכבות של ניטור ועקבות ב-CloudWatch וב-X-Ray, ומנגנוני הערכת איכות לפי דרישה ובאופן רציף. כלל הרכיבים נפרסים באופן אוטומטי באמצעות שרשרת של ארבע מחסניות AWS CloudFormation.

קרא עוד
חידושים בתשתיות ותזמור בינה מלאכותית ב-Google Cloud
חדשות
4 דקות
מ־Google Cloud AI

חידושים בתשתיות ותזמור בינה מלאכותית ב-Google Cloud

גוגל קלאוד (Google Cloud) פרסמה סקירה מקיפה של עדכוני תשתיות ותזמור AI לחודשים מאי עד אוגוסט 2026. בין החידושים: שכבת אחסון חדשה ל-Filestore המבוססת על מערכת Colossus לתמיכה בקבוצות סוכני AI, סביבות gVisor בתוך אשכולות Ray מבוזרים על גבי GKE, מופעי Cloud Run ייעודיים לסוכנים בעלות של 5.70 דולר ל-30 יום, והפיכת ליבת פרוטוקול MCP לחסרת מצב (stateless). כמו כן הוצגו זמינות כללית ל-Managed Lustre ולמכונות C4N, כלי אבטחה בקוד פתוח בשם k8s-aibom, שדרוגי ביצועים ב-GKE Inference Gateway, ותוצאות סקר שבו 83% מהארגונים ציינו צורך בשדרוג תשתיות עבור יישומי Agentic AI.

קרא עוד