חיפוש בחדשות

3 תוצאות עבור "Kaggle".

מסגרת מדידת AGI של Google DeepMind: מה זה אומר לעסקים
ניתוח
6 דקות
מ־DeepMind

מסגרת מדידת AGI של Google DeepMind: מה זה אומר לעסקים

**מדידת התקדמות ל-AGI היא מעבר משיח עמום על "בינה כללית" למסגרת בדיקה של 10 יכולות קוגניטיביות, עם השוואה לבני אדם.** זה המהלך החדש של Google DeepMind, לצד האקתון של Kaggle עם פרסים בהיקף 200 אלף דולר. עבור עסקים בישראל, המשמעות אינה פילוסופית אלא תפעולית: איך בודקים אם מודל מתאים לשירות לקוחות, מכירות או תפעול. במקום להתרשם מדמו, צריך למדוד זיכרון, קשב, למידה וקוגניציה חברתית בתוך תהליכים אמיתיים כמו WhatsApp, Zoho CRM ו-N8N. מי שיאמץ גישת מדידה כזו יקטין סיכון בפרויקטי AI וישפר את סיכויי ההצלחה של פיילוטים עסקיים.

קרא עוד
DARE-bench למשימות דאטה סיינס: למה גם מודלים חזקים נכשלים
מחקר
6 דקות
מ־arXiv cs.AI

DARE-bench למשימות דאטה סיינס: למה גם מודלים חזקים נכשלים

**DARE-bench הוא בנצ'מרק חדש שבודק אם מודלי שפה יודעים לבצע משימות דאטה סיינס לפי תהליך מוגדר — ולא רק להפיק תשובה משכנעת.** לפי התקציר ב-arXiv, הוא כולל 6,300 משימות מבוססות Kaggle עם אמת מידה ניתנת לאימות, ומראה שגם מודלים חזקים כמו gpt-o4-mini מתקשים במיוחד במשימות modeling. עבור עסקים בישראל, הלקח רחב יותר מעולם המחקר: אם אתם מחברים LLM ל-WhatsApp, ל-Zoho CRM או ל-N8N, צריך למדוד עמידה בתהליך, שיעור שגיאות והצלחה בכל שלב. הנתונים על שיפור של פי 1.83 ופי 8 אחרי fine-tuning מראים שביצועים טובים מגיעים מהתאמה למשימה — לא רק מבחירת מודל גדול.

קרא עוד