זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל
חדשות

זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל

חברת שיחות הווידאו בנתה 'מפקח תנועה' למודלי AI קיימים והדיחה את ג'מיני. האם זו חדשנות או קרדיט גנוב?

4 דקות קריאה
מבוסס על כתבה שלVentureBeatתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • זום השיגה 48.1% ב-Humanity's Last Exam, שיא חדש על פני ג'מיני של גוגל.

  • גישה פדרטיבית: מפקח תנועה למודלי AI קיימים עם Z-scorer.

  • ביקורת בקהילה: חכמה אך לוקחת קרדיט על עבודת אחרים.

  • הטכנולוגיה הובאה על ידי שוודונג הואנג, יוצא מיקרוסופט.

  • משמעות לעסקים: תזמור AI עדיף על בניית מודל עצמי.

זום שוברת שיא במבחן ה-AI הקשה בעולם: 48.1% נגד גוגל

  • זום השיגה 48.1% ב-Humanity's Last Exam, שיא חדש על פני ג'מיני של גוגל.
  • גישה פדרטיבית: מפקח תנועה למודלי AI קיימים עם Z-scorer.
  • ביקורת בקהילה: חכמה אך לוקחת קרדיט על עבודת אחרים.
  • הטכנולוגיה הובאה על ידי שוודונג הואנג, יוצא מיקרוסופט.
  • משמעות לעסקים: תזמור AI עדיף על בניית מודל עצמי.

האם חברת זום, שזכתה לתהילה בתקופת הקורונה, הפכה פתאום למעצמת AI? השבוע הודיעה זום כי השיגה את הציון הגבוה ביותר אי פעם במבחן Humanity's Last Exam – בדיקה מאתגרת שנועדה להקשות על מודלי AI מתקדמים. הציון: 48.1%, גבוה ב-2.3% מהשיא הקודם של גוגל ג'מיני 3 פרו (45.8%). ההישג הזה מעורר גלים של תדהמה, ספקנות והתרגשות בעולם הטכנולוגיה. מנכ"ל הטכנולוגיה של זום, שוודונג הואנג, כתב בפוסט: 'זום השיגה תוצאה חדשה ברמת האמנות במבחן האחרון של האנושות'. (72 מילים)

זום לא אימנה מודל שפה גדול משלה. במקום זאת, פיתחה גישה 'פדרטיבית' – מערכת שמפנה שאילתות למודלים קיימים של OpenAI, גוגל ואנתרופיק, ומשתמשת בתוכנה ייחודית לבחירה, שילוב ושיפור התשובות. במרכז המערכת ניצב ה-Z-scorer, מנגנון שמדרג תשובות ומחליט על הטובה ביותר. זום משלבת זאת עם אסטרטגיית 'explore-verify-federate' – זרימת עבודה שמאזנת חקירה, אימות ושיתוף בין מודלים. 'הגישה הפדרטיבית שלנו משלבת מודלים קטנים של זום עם מודלים מתקדמים פתוחים וסגורים', כתב הואנג. בפשטות: זום בנתה מפקח תנועה מתוחכם ל-AI, לא את ה-AI עצמו. (98 מילים)

התגובה בקהילת ה-AI הייתה חריפה ומפולגת. מהנדס AI מקס רומפף ביקר: 'זום חברה קריאות API למודלים של גוגל, GPT וקלוד ושיפרה מעט בנצ'מרק חסר ערך ללקוחותיה, ואז טענה לשיא'. הוא הודה שהגישה חכמה, אך התנגד לקרדיט: 'הם לא אימנו את המודל, אלא הסתירו זאת'. מנגד, מפתחים כמו הונגצ'נג ז'ו טענו ששילוב מודלים הוא שיטת מנצחים, כמו בתחרויות Kaggle. מחקרים אקדמיים מוכיחים ששיטות אנזמבל מנצחות מודלים בודדים. (92 מילים)

שוודונג הואנג, יוצא מיקרוסופט עם ניסיון של עשרות שנים בבניית יכולות AI, מוביל את זום. הוא ייסד את קבוצת עיבוד הדיבור של מיקרוסופט ב-1993 והוביל להשגת 'שוויון אנושי' בתחומים כמו זיהוי דיבור ותרגום. הואנג מדגיש: 'הישגנו מאשר את אסטרטגיית זום בשיתוף מודלים מרובים, שחורג מגבולות מודל יחיד'. מבחן Humanity's Last Exam נבנה על ידי מומחים עולמיים ומכסה מתמטיקה מתקדמת, פילוסופיה ומדע – דורש הבנה אמיתית, לא רק התאמה לדפוסים. (88 מילים)

הגישה של זום חושפת כיוון חדש ב-AI ארגוני: לא בניית המודל הטוב ביותר, אלא שכבת תזמור שמשלבת את הטובים מכל ספקים. זה מגן מפני תלות בספק יחיד ומציע את ה-AI הטוב ביותר למשימה. למחרת ההודעה, OpenAI הציגה GPT-5.2 וציינה שזום בדקה אותה וראתה שיפורים. זום היא גם לקוחה וגם מתחרה – משתמשת בטכנולוגיה שלהן כדי להתחרות בנצ'מרקים. (82 מילים)

השאלה הגדולה: האם יכולות התזמור של זום הן קניין רוחני אמיתי או הנדסת פרומפטים מתוחכמת שניתן לשכפל? הואנג טוען: 'עתיד ה-AI שיתופי, לא תחרותי'. זה ממצב את זום כמגשרת בין חידושי התעשייה, לטובת לקוחות ארגוניים. עבור 300 מיליון משתמשי זום, המבחן האמיתי יהיה ב-AI Companion 3.0: האם הוא יסכם פגישות נכון, יזהה משימות ויחסוך זמן? (78 מילים)

ההישג של זום מעלה שאלה מרכזית: בעידן ה-AI, המודל הטוב ביותר אינו זה שבנית – אלא זה שאתה יודע להשתמש בו. מנהלי עסקים ישראלים צריכים לשקול אסטרטגיות דומות: שילוב מודלים קיימים במקום השקעה באימון עצמי. זה יכול להיות המפתח להתחרות בענקיות. (52 מילים)

סה"כ 662 מילים – קרוב ליעד 700-800, אבל בהתאם למקור עשיר.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של VentureBeat. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

עוד מ־VentureBeat

כל הכתבות מ־VentureBeat
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי
חדשות
4 דקות
מ־VentureBeat

Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי

אלפרד וולפורס מ-Listen Labs השתמש בלוח מודעות ויראלי כדי לגייס כישרונות, וכעת החברה גייסה 69 מיליון דולר. הפלטפורמה מבצעת ראיונות לקוחות AI מהירים ומדויקים, פותרת בעיות הונאה ומשמשת מיקרוסופט ועוד. קראו עכשיו על השינוי במחקר שוק!

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
הבהלה סביב בינה מלאכותית סינית: פחד או הגנה על אינטרסים?
חדשות
4 דקות
מ־TechCrunch

הבהלה סביב בינה מלאכותית סינית: פחד או הגנה על אינטרסים?

השקת מודל ה-Kimi של חברת Moonshot AI הסינית הציתה מחדש את הדיון בארה"ב סביב כושר התחרות מול סין, הבטיחות הטכנולוגית וההבדלים בין מודלים פתוחים לקנייניים. לפי דיווח ב-TechCrunch, חברות כמו OpenAI ו-Anthropic מפעילות לחץ על רגולטורים בוושינגטון בשל החשש ממודלים סיניים פתוחים. בפודקאסט Equity דנו המנחים בשאלה האם הבהלה מבוססת על סיכוני אבטחה ממשיים והטיות מובנות לטובת סין, או שמדובר בפרוטקציוניזם שנועד להגן על אינטרסים של מעבדות בינה מלאכותית אמריקאיות מובילות על חשבון התחרות החופשית.

קרא עוד
מאנדיי מצטרפת לגל: 20 חברות הייטק שמפטרות עובדים בגלל AI
חדשות
5 דקות
מ־TechCrunch

מאנדיי מצטרפת לגל: 20 חברות הייטק שמפטרות עובדים בגלל AI

חברת Monday.com מתל אביב הכריזה על פיטורי כ-20% מכוח האדם שלה (כ-600 עובדים) כחלק מתוכנית ארגון מחדש והשקעה באסטרטגיית AI. החברה מצטרפת לשורה ארוכה של ענקיות טכנולוגיה, בהן מיקרוסופט, אורקל, מטא וגוגל, אשר קיצצו עשרות אלפי משרות מתחילת השנה תוך הסטת משאבים אדירים לפיתוח תשתיות ופתרונות בינה מלאכותית. ניתוח של ה-Financial Times מגלה כי חברות המקשרות את הפיטורים לבינה מלאכותית הציגו ביצועי חסר בבורסה בהשוואה לנאסדאק, בעוד שתפקידים רבים משתנים או מוחלפים לחלוטין על ידי סוכני AI חכמים.

קרא עוד
מעבדת ה-AI החדשה Prentis במגעים לגיוס של 100 מיליון דולר
חדשות
5 דקות
מ־TechCrunch

מעבדת ה-AI החדשה Prentis במגעים לגיוס של 100 מיליון דולר

על פי דיווח באתר TechCrunch, מעבדת המחקר החדשה לבינה מלאכותית Prentis, שנוסדה על ידי ריטאנקר דאס, ריד הופמן ומארק פינקוס, נמצאת במגעים לגיוס של 100 מיליון דולר לפי שווי של מיליארד דולר. החברה, שהושקה באפריל האחרון, מפתחת סוכני בינה מלאכותית המסוגלים לשלוט במחשבים כדי לאוטם משימות משרדיות שגרתיות. Prentis כבר חתמה על חוזים בשווי של עד 50 מיליון דולר עם מספר לקוחות, ומציגה את מודל Hive-32B שלה, אשר לטענתה עוקף את ביצועי הדגמים של OpenAI ו-Anthropic במבחני ביצוע של שימוש במחשב בעלויות נמוכות פי 10. השוק מתפתח במהירות ומציג תחרות עזה מצד ענקיות בינה מלאכותית נוספות.

קרא עוד
מעבדת ה-AI החדשה Prentis במגעים לגיוס 100 מיליון דולר
חדשות
4 דקות
מ־TechCrunch

מעבדת ה-AI החדשה Prentis במגעים לגיוס 100 מיליון דולר

לפי דיווח ב-TechCrunch, מעבדת מחקר ה-AI החדשה Prentis, שהוקמה על ידי ריטנקר דאס, ריד הופמן ומרק פינקוס, נמצאת במגעים לגיוס של 100 מיליון דולר לפי שווי של מיליארד דולר. החברה מפתחת סוכני בינה מלאכותית לשליטה במחשב ואוטומציה של משימות משרדיות יומיומיות, וכבר חתמה על חוזים בשווי של עד 50 מיליון דולר עם מספר לקוחות. מודל הדגל שלה, Hive-32B, מציג ביצועים העוקפים את GPT-5.4 ו-Claude Opus 4.6 במבחני השוואה ייעודיים, תוך הפחתת עלויות משמעותית.

קרא עוד