מדידת כישורי עתיד עם GenAI: מה Vantage אומר לארגונים
מחקר

מדידת כישורי עתיד עם GenAI: מה Vantage אומר לארגונים

הניסוי של Google ו-NYU מראה התאמה לרמת בודקים אנושיים — ופותח כיוון חדש להכשרה והערכה

6 דקות קריאה
מבוסס על כתבה שלGoogle Researchתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • Google Research ו-NYU בחנו את Vantage על 188 משתתפים בני 18–25, עם התאמה לציוני מעריכים אנושיים.

  • בניסוי נוסף עם OpenMic על 180 תלמידים, AI Evaluator הגיע למתאם של 0.88 מול מומחים אנושיים.

  • החידוש המרכזי הוא Executive LLM שמכוון שיחה כדי לחשוף מיומנויות כמו פתרון קונפליקטים וניהול פרויקט.

  • בישראל, ארגונים בתחומי שירות, ביטוח, נדל"ן ומרפאות יכולים להריץ פיילוט של 2–4 שבועות עם Zoho CRM, N8N ו-WhatsApp Business API.

  • הערך העסקי אינו רק בהערכה, אלא בחיבור הציון לזרימות עבודה: משוב, הדרכה, תיעוד ומשימות המשך במערכות CRM.

מדידת כישורי עתיד עם GenAI: מה Vantage אומר לארגונים

  • Google Research ו-NYU בחנו את Vantage על 188 משתתפים בני 18–25, עם התאמה לציוני מעריכים...
  • בניסוי נוסף עם OpenMic על 180 תלמידים, AI Evaluator הגיע למתאם של 0.88 מול מומחים...
  • החידוש המרכזי הוא Executive LLM שמכוון שיחה כדי לחשוף מיומנויות כמו פתרון קונפליקטים וניהול פרויקט.
  • בישראל, ארגונים בתחומי שירות, ביטוח, נדל"ן ומרפאות יכולים להריץ פיילוט של 2–4 שבועות עם Zoho...
  • הערך העסקי אינו רק בהערכה, אלא בחיבור הציון לזרימות עבודה: משוב, הדרכה, תיעוד ומשימות המשך...

מדידת כישורי עתיד עם בינה מלאכותית גנרטיבית

מדידת כישורי עתיד באמצעות בינה מלאכותית גנרטיבית היא שיטה להעריך מיומנויות כמו שיתוף פעולה, פתרון קונפליקטים וחשיבה יצירתית בתוך שיחות סימולציה עם אווטארים מבוססי AI. לפי Google Research, בניסוי Vantage נבדקה התאמה לרמת מעריכים אנושיים, על בסיס מחקר עם 188 משתתפים בני 18–25.

הסיבה שזה חשוב עכשיו אינה רק חינוכית. עבור עסקים בישראל, ובעיקר ארגונים שמגייסים, מכשירים ומנהלים צוותים היברידיים, היכולת למדוד מיומנויות רכות באופן עקבי הופכת לנושא תפעולי. לפי דוח Future of Jobs של הפורום הכלכלי העולמי, חשיבה אנליטית, יצירתיות ושיתוף פעולה נשארים בין הכישורים המבוקשים ביותר גם בעידן אוטומציה. המשמעות היא שהשאלה כבר אינה רק איך מלמדים, אלא איך מודדים ומטמיעים משוב בקנה מידה רחב.

מה זה הערכת כישורי עתיד עם GenAI?

הערכת כישורי עתיד עם GenAI היא תהליך שבו מודל שפה מנהל סביבה מדומה, מציג אתגרי אינטראקציה, ולאחר מכן מדרג ביצועים לפי רובריקה מוגדרת מראש. בהקשר עסקי, מדובר בכלי שיכול לעזור להעריך יכולות כמו ניהול פרויקט, תקשורת בין-אישית וקבלת החלטות תחת לחץ. לדוגמה, חברה ישראלית שמכשירה מנהלי צוות יכולה להריץ סימולציה של ישיבת פרויקט עם התנגדויות, ולבדוק אם העובד יודע ליישב מחלוקת, לנסח סדרי עדיפויות ולשמור על שיתוף פעולה. לפי המחקר שפורסם, המערכת הותאמה לרובריקות פדגוגיות ולא פעלה רק על תחושת בטן של המודל.

מה Google הציגה בניסוי Vantage

לפי הדיווח של Google Research, Vantage הוא ניסוי מחקרי שזמין כעת דרך Google Labs באנגלית, ומיועד בשלב זה לתלמידי תיכון וסטודנטים. המערכת מציבה את המשתמש בתוך שיחה מרובת משתתפים עם אווטארים מבוססי AI, סביב משימות פתוחות כמו הכנה לדיבייט או גיבוש רעיון יצירתי. רכיב מרכזי במערכת הוא Executive LLM, שמכוון את השיחה כך שיופיעו רגעים שמאפשרים למדוד מיומנות ספציפית — למשל התנגדות לרעיון, קונפליקט בין חברי צוות או צורך בתיאום משימות.

בהמשך התהליך, לפי Google, רכיב נוסף בשם AI Evaluator מנתח את תמליל השיחה מול אותה רובריקה ומחזיר מפת מיומנויות עם ציון ומשוב איכותני. במחקר המשותף עם New York University השתתפו 188 בודקים בגילי 18–25 בארה"ב, במשימות שבחנו פתרון קונפליקטים וניהול פרויקט. לפי הנתונים שפורסמו, רמת ההסכמה בין המערכת לבין מעריכים אנושיים הייתה דומה לרמת ההסכמה בין שני מעריכים אנושיים. זה אינו אומר שהמודל "מבין אנשים" באופן מלא, אבל כן מצביע על כך שאפשר להגיע לאוטומציה אמינה יחסית בהערכת שיחה מורכבת.

נתון נוסף מהמחקר

Google דיווחה גם על שיתוף פעולה נוסף עם OpenMic, סטארט-אפ שמפתח כלים להערכת מיומנויות מתמשכות. בניסוי נוסף נותחו עבודות של 180 תלמידים במשימות יצירתיות הקשורות לספרות ואנגלית. לפי החברה, נמצא מתאם גבוה בין ציוני המערכת לבין ציוני מומחים אנושיים, עם Pearson correlation של 0.88. זה נתון משמעותי, משום שהוא מרמז שהמודל לא הוגבל רק לשני תחומי הערכה צרים, אלא הצליח לשמור על עקביות גם במשימות פתוחות ומורכבות יותר.

ההקשר הרחב: לא רק חינוך, אלא גם כוח אדם והכשרה

החדשות האלה יושבות על מגמה רחבה יותר. לפי McKinsey, ארגונים ברחבי העולם משקיעים יותר במדידה והסבה של כישורים מאשר בהגדרות תפקיד קשיחות, משום שתכולת העבודה משתנה מהר יותר ממבני הארגון. במקביל, LinkedIn דיווחה בשנים האחרונות על עלייה עקבית בחשיבות כישורים בין-אישיים ויכולת הסתגלות. לכן, גם אם Vantage נבנה כרגע עבור חינוך, קל לראות איך טכנולוגיה דומה תזלוג להכשרת עובדים, הערכת מועמדים, אונבורדינג ומרכזי הערכה דיגיטליים. המתחרים לא יגיעו רק מעולם האד-טק, אלא גם מ-HR Tech, פלטפורמות LMS ומערכות ביצועים ארגוניות.

ניתוח מקצועי: למה הסיפור האמיתי הוא מנוע הערכה אדפטיבי

מניסיון בהטמעה אצל עסקים ישראליים, המשמעות האמיתית כאן אינה "עוד בוט שמדבר יפה", אלא הופעתו של מנגנון הערכה אדפטיבי שאפשר לחבר לתהליך עסקי. ברגע שמודל אחד מנהל את השיחה לפי רובריקה, ומודל אחר מדרג את התוצאה באותה שיטה, נוצר מבנה שאפשר לשכפל בין מחלקות, סניפים ושפות. זה קריטי במיוחד בארגונים שרוצים סטנדרטיזציה. בעולם האמיתי, הבעיה הגדולה אינה מחסור במידע אלא חוסר עקביות: מנהל אחד נותן משוב קשוח, אחר מתעלם, ושלישי בודק לפי אינטואיציה. מערכת כמו Vantage מנסה להפוך הערכה כזו למבוססת תסריט, תיעוד וקריטריונים.

מנקודת מבט של יישום בשטח, זה גם מתחבר ישירות לסטאק שאנחנו רואים יותר ויותר בארגונים: AI Agents לצורך שיחה והדרכה, WhatsApp Business API לצורך ממשק נוח למשתמש, CRM חכם לתיעוד תוצאות, ו-N8N לזרימת עבודה אוטומטית בין מערכות. לדוגמה, אפשר לדמיין תהליך שבו מועמד או עובד מבצע סימולציה, הציון זורם ל-Zoho CRM או למערכת HR, ו-N8N מפעיל מסלול המשך: קורס, חניכה או זימון לשיחת מנהל. זו כבר לא תיאוריה של מעבדה, אלא תבנית מוצרית שיכולה להופיע בהרבה מאוד תהליכים ארגוניים בתוך 12 עד 18 חודשים.

ההשלכות לעסקים בישראל

בשוק הישראלי, ההשלכה המיידית אינה בהכרח בבתי ספר אלא בארגונים שצריכים למדוד אינטראקציה אנושית: מוקדי שירות, רשתות מכירה, משרדי עורכי דין, סוכנויות ביטוח, מרפאות פרטיות וחברות נדל"ן. בכל אחד מהתחומים האלה יש ערך עסקי ברור ליכולת לבדוק איך עובד מגיב להתנגדות, איך הוא מתאם ציפיות, ואיך הוא מציג חלופות. במוקד שירות, למשל, אפשר לבדוק שיחת לקוח כועס; במשרד עורכי דין אפשר לדמות שיחת לקוח בלחץ; ובמרפאה פרטית אפשר לבדוק קבלת החלטות תחת מגבלת זמן. אלו אינם כישורים תאורטיים, אלא מרכיבים שמשפיעים על הכנסות, נטישה וחוויית לקוח.

כאן נכנסים גם שיקולים מקומיים. בישראל חייבים להתייחס לשפה עברית, לניואנסים תרבותיים, ולרגולציה סביב פרטיות ושמירת מידע. אם ארגון מתעד סימולציות שיחה עם עובדים או מועמדים, עליו לבחון את אופן השמירה, הגישה והרשאות המידע בהתאם לחוק הגנת הפרטיות ולנהלי אבטחת מידע. בנוסף, הטמעה סבירה בארגון בינוני אינה חייבת להיות יקרה במיוחד: פיילוט של 2–4 שבועות עם מודל שפה, חיבור ל-Zoho CRM, ותזמור ב-N8N יכול לנוע בטווח של אלפי שקלים בודדים עד עשרות אלפי שקלים, בהתאם למספר המשתמשים ולמורכבות הרובריקה. מי שרוצה ליישם זאת נכון צריך לחשוב לא רק על המודל, אלא על אוטומציה עסקית, תיעוד, משוב, וערוץ הפעלה כמו WhatsApp Business API או פורטל פנימי.

מה לעשות עכשיו: צעדים מעשיים

  1. בדקו אם מערכות הליבה שלכם — Zoho CRM, Monday, HubSpot או מערכת HR פנימית — תומכות ב-API שיכול לקלוט תוצאות הערכה.
  2. הריצו פיילוט של שבועיים על תרחיש אחד בלבד, למשל פתרון קונפליקט במוקד שירות או שיחת מכירה ראשונה. הגדרה צרה תייצר נתונים טובים יותר.
  3. בנו רובריקה ברורה עם 3–5 קריטריונים מדידים, ולא רשימת תכונות כללית. בלי רובריקה, גם LLM טוב לא ייתן ציון עקבי.
  4. חברו את התהליך ל-N8N כדי שכל תוצאה תיצור פעולה: הדרכה, משוב למנהל, או פתיחת משימה במערכת.

מבט קדימה על סימולציות AI להכשרת עובדים

בטווח של 12–18 חודשים, סביר שנראה מעבר מניסויי מחקר כמו Vantage לכלים מסחריים שמעריכים עובדים, מועמדים וספקי שירות על בסיס שיחה מדומה. מה שכדאי לעקוב אחריו הוא לא רק דיוק הציון, אלא גם שאלת ההעברה לעולם האמיתי: האם מי שמצליח מול אווטאר אכן מצליח מול לקוח. עבור עסקים בישראל, התגובה הנכונה תהיה לבחון כבר עכשיו סטאק שמשלב AI Agents, WhatsApp, CRM ו-N8N — כי שם צפויה להיווצר שכבת ההפעלה הפרקטית.

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של Google Research. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

עוד מ־Google Research

כל הכתבות מ־Google Research
SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים
מחקר
5 דקות
מ־Google Research

SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים

מחקר לאומי ראשון מסוגו שנערך על ידי Google Research בוחן את ביצועיו של SymptomAI – מערך סוכני בינה מלאכותית שיחתיים מבוססי Gemini Flash 2.0 המיועדים לראיונות סימפטומים והערכת אבחנה מבדלת (DDx). המחקר, שהקיף 13,917 משתתפים, השווה את האבחנות המבדלות שהפיק הסוכן אל מול הערכות של פאנל רופאים מומחים ודיווחים מביקורים רפואיים בעולם האמיתי. הממצאים מראים כי קלינאים העדיפו את אבחנות הסוכן בלמעלה מ-50% מהמקרים, וכי דיוק המערכת השתפר משמעותית באמצעות אסטרטגיות הנחיה אקטיביות. בנוסף, המחקר הדגים מתאם מובהק בין אבחנות המערכת לבין שינויים באותות פיזיולוגיים שנמדדו במכשירי פיטביט לבישים.

קרא עוד
לקראת מחשב קוונטי הלומד משגיאותיו באמצעות למידת חיזוק
מחקר
5 דקות
מ־Google Research

לקראת מחשב קוונטי הלומד משגיאותיו באמצעות למידת חיזוק

חוקרי Google Quantum AI ו-Google Research הציגו בכתב העת Nature פריצת דרך המשלבת למידת חיזוק (RL) עם תיקון שגיאות קוונטי (QEC). החוקרים, וולודימיר סיבאק ופול קלימוב, פיתחו סוכן אוטונומי המנטר את אירועי גילוי השגיאות ומנווט ברציפות אלפי פרמטרי בקרה כדי למנוע סחיפה של החומרה בזמן החישוב. בניסוי על מעבד המוליך-על Willow, שיטה זו שיפרה את היציבות הלוגית פי 3.5 והפחיתה את שיעור השגיאות הלוגיות ב-20% נוספים לאחר כיול ידני של מומחים, מה שהוביל לרמות שגיאה נמוכות במיוחד בקוד משטח ובקוד צבע. סימולציות מוכיחות כי הגישה ניתנת להרחבה למערכות קוונטיות גדולות ללא פגיעה בקצב הלמידה.

קרא עוד
כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research
מחקר
4 דקות
מ־Google Research

כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research

בפוסט חדש מטעם Google Research, מדען המחקר ג'נגדאו צ'ן מציג ממצאים מתוך מאמר שהתקבל לוועידת ICLR 2026, המפענח את מקור ה'יצירתיות' של מודלי דיפוזיה. לפי המחקר, היכולת של המודלים הללו לייצר נתונים חדשים, במקום לשנן באופן עיוור את מאגר האימון שלהם, היא תוצאה מתמטית של תהליך החלקת פונקציית הציון (score smoothing). החלקה זו נגרמת באופן טבעי בשל השפעות רגולריזציה במהלך אימון הרשתות העצביות, המונעות מהן ללמוד פונקציות בעלות מעברים חדים במיוחד. כתוצאה מכך, המודל מייצר אינטרפולציה במרווחים שבין נקודות המידע המקוריות של האימון. בסביבה רב-ממדית, אפקט זה פועל בכיוונים המשיקים ליריעת הנתונים הנסתרת, וכך מאפשר להשיג איזון מדויק בין איכות הנתונים לבין היצירתיות שלהם.

קרא עוד
ניתוב תנועה שיתופי: פתרון Google Research לפקקים
מחקר
5 דקות
מ־Google Research

ניתוב תנועה שיתופי: פתרון Google Research לפקקים

מחקר מבוקר של Google Research (זרוע המחקר של גוגל) שפורסם בכתב העת Nature Cities מוכיח כי יישום אלגוריתם של ניתוב תנועה שיתופי באפליקציית Google Maps מביא לשיפור של 2% במהירות הנסיעה בצווארי בקבוק מרכזיים. בניסוי שנמשך שישה חודשים ב-10 ערים בארצות הברית, החוקרים נהה ארורה ואבודי קריידיה הציגו מסלולים חלופיים דומים לנהגים, והסיטו בפועל פחות מ-2% מכלל הנסיעות. למרות השינוי המינורי, נרשמה ירידה חציונית של 0.5% עד 1% בצריכת הדלק במקטעים הממוקדים ועלייה חציונית של 0.35% במהירות הנסיעה ברשת כולה. המחקר מבסס מודל יישומי ראשון מסוגו לניהול עומסים מערכתי.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים
מחקר
5 דקות
מ־Google Research

SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים

מחקר לאומי ראשון מסוגו שנערך על ידי Google Research בוחן את ביצועיו של SymptomAI – מערך סוכני בינה מלאכותית שיחתיים מבוססי Gemini Flash 2.0 המיועדים לראיונות סימפטומים והערכת אבחנה מבדלת (DDx). המחקר, שהקיף 13,917 משתתפים, השווה את האבחנות המבדלות שהפיק הסוכן אל מול הערכות של פאנל רופאים מומחים ודיווחים מביקורים רפואיים בעולם האמיתי. הממצאים מראים כי קלינאים העדיפו את אבחנות הסוכן בלמעלה מ-50% מהמקרים, וכי דיוק המערכת השתפר משמעותית באמצעות אסטרטגיות הנחיה אקטיביות. בנוסף, המחקר הדגים מתאם מובהק בין אבחנות המערכת לבין שינויים באותות פיזיולוגיים שנמדדו במכשירי פיטביט לבישים.

קרא עוד
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research
מחקר
4 דקות
מ־Google Research

כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research

בפוסט חדש מטעם Google Research, מדען המחקר ג'נגדאו צ'ן מציג ממצאים מתוך מאמר שהתקבל לוועידת ICLR 2026, המפענח את מקור ה'יצירתיות' של מודלי דיפוזיה. לפי המחקר, היכולת של המודלים הללו לייצר נתונים חדשים, במקום לשנן באופן עיוור את מאגר האימון שלהם, היא תוצאה מתמטית של תהליך החלקת פונקציית הציון (score smoothing). החלקה זו נגרמת באופן טבעי בשל השפעות רגולריזציה במהלך אימון הרשתות העצביות, המונעות מהן ללמוד פונקציות בעלות מעברים חדים במיוחד. כתוצאה מכך, המודל מייצר אינטרפולציה במרווחים שבין נקודות המידע המקוריות של האימון. בסביבה רב-ממדית, אפקט זה פועל בכיוונים המשיקים ליריעת הנתונים הנסתרת, וכך מאפשר להשיג איזון מדויק בין איכות הנתונים לבין היצירתיות שלהם.

קרא עוד