חיפוש בחדשות

30 תוצאות עבור "מודלים מתקדמים".

שחזור מידע הוא צוואר הבקבוק של עובדתיות במודלי שפה
מחקר
5 דקות
מ־Google Research

שחזור מידע הוא צוואר הבקבוק של עובדתיות במודלי שפה

פוסט מחקר חדש של מדעני Google Research, ניתאי קלדרון וגל יונה, מציג את מסגרת 'פרופילי הידע' ואת מדד WikiProfile המבוסס על 2,150 עובדות מוויקיפדיה. המחקר חושף כי שגיאות עובדתיות במודלי שפה מתקדמים כמו Gemini 3 ו-GPT-5 אינן נובעות מהיעדר המידע בפרמטרים (כשל קידוד), אלא מקושי של המודל לגשת אליו ולשחזר אותו באופן עצמאי (כשל שחזור). במודלי הקצה המובילים, כ-95% עד 98% מהעובדות מקודדות, אך המודלים נכשלים בשחזור ישיר של 26% עד 34% מהן. המחקר מדגים כי מנגנון חשיבה יכול לסייע בשחזור של כ-40% עד 65% מהעובדות המקודדות הללו, במיוחד במקרים של עובדות נדירות או שאלות הפוכות (קללת ההיפוך), ובכך הוא מהווה כלי יעיל לפתרון צוואר הבקבוק של השחזור.

קרא עוד
הסטארטאפים שמחפשים את פריצת הדרך הבאה בעולם ה-LLM
ניתוח
6 דקות
מ־MIT Technology Review

הסטארטאפים שמחפשים את פריצת הדרך הבאה בעולם ה-LLM

מאז 2017, ארכיטקטורת הטרנספורמר מניעה את כל מודלי השפה הגדולים (LLM) המובילים בשוק. אולם, מנגנון הקשב הצפוף שלה דורש משאבי חישוב ואנרגיה עצומים, המהווים כיום צוואר בקבוק משמעותי לפיתוח מודלים מתקדמים וסוכני AI. כתבה זו סוקרת ארבעה כיווני פיתוח חדשניים ופורצי דרך של חברות סטארטאפ המנסות להחליף או לשפר את הטרנספורמרים: החל ממנגנוני קשב דליל ושימור כוח (power retention), דרך רשתות עצביות נוזליות המאפשרות למידה בזמן אמת, שימוש בטכנולוגיית דיפוזיה ליצירת טקסט שלם בבת אחת, ועד שימוש במרחבי מצב מתמטיים למעבר מעבר למגבלות השפה והמילים.

קרא עוד
רגולציה של מודלי בינה מלאכותית: ממשל טראמפ מאשר שחרור מוגבל של Mythos
חדשות
5 דקות
מ־Wired

רגולציה של מודלי בינה מלאכותית: ממשל טראמפ מאשר שחרור מוגבל של Mythos

ממשל טראמפ אישר לחברת Anthropic (אנתרופיק) להשיק מחדש באופן מוגבל את מודל ה-AI המתקדם ביותר שלה, Claude Mythos 5, עבור כ-100 ארגונים וסוכנויות ממשלתיות בארצות הברית. ההחלטה התקבלה לאחר שבועות של הגבלות קשות ומשא ומתן קדחתני שניהלו בכירי החברה, בהם סמנכ"ל המחשוב Tom Brown (טום בראון) וראש מחלקת המדיניות Sarah Heck (שרה הק), מול שר המסחר Howard Lutnick (הווארד לוטניק). המגבלות המקוריות הוטלו מחשש לפרצות אבטחה וקשרים עם גורמים זרים, ביניהם SK Telecom (חברת תקשורת דרום קוריאנית) החשודה בקשרים עם סין. הצעד מסמן מעבר של תעשיית ה-AI לעידן של אישורים ממשלתיים הדוקים טרם הפצת מודלים מתקדמים.

קרא עוד
פיקוח ממשלתי על בינה מלאכותית: הקרב בין OpenAI לאנתרופיק עולה שלב
חדשות
5 דקות
מ־TechCrunch

פיקוח ממשלתי על בינה מלאכותית: הקרב בין OpenAI לאנתרופיק עולה שלב

הפיקוח הממשלתי על בינה מלאכותית בארצות הברית עולה מדרגה ומקפיא את פיתוחי הענק. לפי חשיפת אתר The Information, הממשל הגביל את הפצת מודל GPT-5.6 של OpenAI לאישור פרטני של "לקוח אחר לקוח", שבועות ספורים לאחר שחסם את הפצת המודלים Fable ו-Mythos של חברת Anthropic. המהלכים הרגולטוריים הללו מעכבים את השחרור המסחרי של מודלים מתקדמים, משפיעים על קצב הקמת מרכזי הנתונים ומכריחים את שתי המתחרות הגדולות לשתף פעולה מול הממשל כדי למנוע האטה קריטית של התעשייה כולה.

קרא עוד
ניהול תקציב בינה מלאכותית: חברות בולמות בזבוז על משימות קטנות
ניתוח
4 דקות
מ־TechCrunch

ניהול תקציב בינה מלאכותית: חברות בולמות בזבוז על משימות קטנות

מחקרים ונתונים שפורסמו לאחרונה, כולל חשיפה של 404 Media לגבי חברת הייעוץ Accenture, מראים כי חברות רבות מתמודדות עם עלייה בלתי נשלטת בהוצאות ה-AI שלהן. עובדים המשתמשים במודלים מתקדמים למשימות פשוטות כמו המרת קבצי PDF למצגות שוחקים במהירות את תקציבי ה-API של הארגונים, בתופעה המכונה "Tokenmaxxing". המנהלים הבכירים, בהם מנהלי כספים (CFOs), מדווחים כי העלויות הופכות לבלתי צפויות ללא החזר השקעה ברור, מה שמוביל למדיניות חדשה של "קיצוב טוקנים" והגבלת הגישה לכלים יקרים.

קרא עוד
רגולציית AI בארה"ב: המאבק שעלול לעכב שחרור מודלים ב-90 יום
חדשות
4 דקות
מ־Wired

רגולציית AI בארה"ב: המאבק שעלול לעכב שחרור מודלים ב-90 יום

ממשל טראמפ נמצא במאבק פנימי דרמטי סביב ניסיונות להחיות צו נשיאותי הנוגע לרגולציה על פיתוח מודלים של בינה מלאכותית, אשר בוטל במפתיע בחודש שעבר. הדיווח במגזין WIRED חושף כי המחלוקת בצמרת הממשל נסובה על סעיף המבקש לאלץ חברות טכנולוגיה מובילות, כמו OpenAI ו-Anthropic, להעביר לממשל האמריקאי גישה למודלים מתקדמים עד 90 יום לפני השקתם הפומבית. בעוד בכירים בבית הלבן דוחפים להסדרה שתמנע איומי סייבר משמעותיים, מתנגדי המהלך טוענים כי הרגולציה עלולה לחנוק את החדשנות ולפגוע ביתרון התחרותי מול סין. עבור עסקים בישראל, החלטות אלו עשויות לייצר עיכובים באספקת שדרוגים קריטיים, ולהשפיע ישירות על כלים עסקיים יומיומיים מבוססי AI.

קרא עוד
הטמעת סוכני AI אוטונומיים בארגונים: מפתח למהפכת הפיתוח של Anthropic
חדשות
6 דקות
מ־Wired

הטמעת סוכני AI אוטונומיים בארגונים: מפתח למהפכת הפיתוח של Anthropic

מהפכת סוכני ה-AI האוטונומיים, אותה מובילה בין היתר Anthropic באמצעות Claude Code, משנה מהיסוד את האופן שבו ארגונים כותבים קוד ומנהלים מערכות. במקום שמפתח יכתוב שורות קוד בודדות, חברות משתמשות היום בסוכנים וירטואליים שרצים ברקע לאורך ימים, מתקנים באגים ומנהלים תהליכי ארכיטקטורה מורכבים באופן כמעט עצמאי לחלוטין. פרויקטים כמו OpenClaw הפכו את היכולות הללו לזמינות גם דרך ממשקי מסרים פשוטים כמו WhatsApp ו-Slack, ויצרו היסטריה בתעשייה עם מאות אלפי הורדות. עם זאת, התלות הגוברת בכלים הללו מחייבת ארגונים להטמיע מנגנוני בקרה באמצעות פלטפורמות עזר כמו N8N ולהיערך לעלויות חישוב כבדות וסיכוני אבטחת מידע חמורים שעשויים להיגרם מפתיחת הרשאות לא מבוקרת לסוכנים חיצוניים.

קרא עוד
מירוץ החימוש החדש: מדוע ג'נרל מוטורס מפטרת אנשי IT לטובת מומחי AI?
חדשות
4 דקות
מ־TechCrunch

מירוץ החימוש החדש: מדוע ג'נרל מוטורס מפטרת אנשי IT לטובת מומחי AI?

תעשיית הרכב עוברת טלטלה משמעותית במבנה כוח האדם שלה כתוצאה מכניסת כלי בינה מלאכותית. על פי נתונים חדשים, חברת ג'נרל מוטורס קיצצה כ-10% ממחלקת ה-IT שלה, המהווים כ-600 עובדים, במסגרת מהלך אסטרטגי של החלפת כישורים שנועד לגייס מפתחי AI ומהנדסי דאטה. יחד עם פורד וסטלנטיס, תעשיית הרכב האמריקאית נפרדה כבר מכ-20,000 משרות בעשור האחרון. המעבר ליישומים מבוססי נתונים מאפשר לחברות כמו Samsara להפוך מידע מצילומי דרך למודלים מתקדמים לזיהוי מפגעים הנמכרים לעיריות כמו שיקגו, וממחיש כי ארגונים טכנולוגיים נדרשים לפתח מיומנויות של בניית מודלים מאפס, ולא להסתמך רק על תחזוקת רשתות מסורתית.

קרא עוד
מסחר בין סוכני AI: מה מלמד ניסוי Project Deal של Anthropic
ניתוח
6 דקות
מ־TechCrunch

מסחר בין סוכני AI: מה מלמד ניסוי Project Deal של Anthropic

**מסחר בין סוכני AI הוא מעבר ממערכות שממליצות לאנשים מה לעשות למערכות שמנהלות אינטראקציה עסקית בעצמן.** בניסוי Project Deal של Anthropic השתתפו 69 עובדים, נסגרו 186 עסקאות, והשווי המצטבר עבר 4,000 דולר. הממצא החשוב ביותר לא היה רק שהעסקאות הצליחו, אלא שמודלים מתקדמים יותר השיגו תוצאות טובות יותר — בלי שהמשתמשים תמיד הבחינו בכך. עבור עסקים בישראל, זו אזהרה והזדמנות יחד: מי שיחבר נכון בין AI, WhatsApp Business API, Zoho CRM ו-N8N יוכל לקצר זמני תגובה ולשפר תהליכי מכירה, אבל חייב להגדיר גבולות מחיר, תיעוד והרשאות לפני שנותנים לסוכן לנהל משא ומתן בפועל.

קרא עוד
τ-Knowledge לבנקאות: למה סוכנים שיחתיים עדיין נכשלים
מחקר
5 דקות
מ־arXiv cs.AI

τ-Knowledge לבנקאות: למה סוכנים שיחתיים עדיין נכשלים

**τ-Knowledge הוא בנצ'מרק חדש שבודק האם סוכן שיחתי יודע לשלב ידע לא מובנה עם פעולות מערכת אמיתיות.** לפי התקציר ב-arXiv, גם מודלים מתקדמים הגיעו לכ-25.5% הצלחה בלבד במשימות שירות פיננסי המבוססות על כ-700 מסמכי ידע. עבור עסקים בישראל, המשמעות ברורה: בוט שנשמע טוב לא בהכרח יודע לעבוד נכון מול נהלים, CRM ו-WhatsApp. לפני שמאפשרים לסוכן AI לעדכן סטטוסים, הרשאות או פרטי לקוח, צריך לבנות בסיס ידע מסודר, שכבת בקרה ותהליך מדידה. זה נכון במיוחד לביטוח, מרפאות, נדל"ן ומשרדי עורכי דין, שבהם טעות אחת עלולה להפוך מבעיה שיחתית לבעיה תפעולית או רגולטורית.

קרא עוד
LogicGraph בוחן מסלולי הוכחה מרובים ב-LLM
מחקר
5 דקות
מ־arXiv cs.AI

LogicGraph בוחן מסלולי הוכחה מרובים ב-LLM

**LogicGraph הוא בנצ'מרק חדש שבודק אם מודלי שפה יודעים להגיע לאותה מסקנה דרך כמה מסלולי הוכחה תקפים, ולא רק לייצר תשובה נכונה אחת.** לפי המחקר, מודלים מתקדמים נוטים להינעל מוקדם על מסלול יחיד, והפער בכיסוי החלופות גדל ככל שעומק ההסקה עולה. עבור עסקים בישראל זו נקודה קריטית: כשמחברים מודל שפה ל-WhatsApp Business API, ל-Zoho CRM ול-N8N, כל החלטה מפעילה פעולה עסקית אמיתית. לכן לפני שמטמיעים סוכן AI בשירות, ביטוח, נדל"ן או מרפאה, צריך למדוד לא רק דיוק אלא גם כיסוי של חלופות, טיפול בחריגים ובקשות הבהרה.

קרא עוד
LemonadeBench: בדיקת אינטואיציה כלכלית של AI בעסק לימונדע
מחקר
5 דקות
מ־arXiv cs.AI

LemonadeBench: בדיקת אינטואיציה כלכלית של AI בעסק לימונדע

**LemonadeBench בודק אינטואיציה כלכלית של LLMs בסימולציית עסק לימונדע ל-30 יום.** מודלים מתקדמים מגיעים ל-70% אופטימלי. לעסקים ישראלים: הזדמנות להטמיע סוכני AI לניהול מלאי ותמחור, חיסכון של 20-30% בעלויות.

קרא עוד
מדדי אמינות לסוכני AI: 12 מדדים חדשים לבדיקת עקביות ובטיחות
מחקר
5 דקות
מ־arXiv cs.AI

מדדי אמינות לסוכני AI: 12 מדדים חדשים לבדיקת עקביות ובטיחות

**מדדי אמינות לסוכני AI: 12 מדדים חדשים לעקביות, עמידות, צפיות ובטיחות.** מחקר ב-arXiv מראה ש-14 מודלים מתקדמים משפרים יכולות אך לא אמינות. לעסקים ישראלים ב-[סוכני AI לעסקים](/services/ai-agents) זה אומר לבדוק מעבר לדיוק פשוט, כדי למנוע אובדן הכנסות מ-20,000 ₪ בחודש.

קרא עוד
מתחרות AI ענקיות משתפות פעולה: מאיץ סטארטאפים חדש בפריז
חדשות
4 דקות
מ־Wired

מתחרות AI ענקיות משתפות פעולה: מאיץ סטארטאפים חדש בפריז

ענקיות AI כמו OpenAI ו-Google משתפות פעולה ראשונה מסוגה במאיץ F/ai בפריז. 20 סטארטאפים אירופאים מקבלים קרדיטים במיליון דולר ומסחור מהיר. הזדמנות לעסקים ישראליים ללמוד ולהתממשק. גלו כיצד ליישם AI בעסק שלכם.

קרא עוד
Oogiri-Master: בנצ'מרק חדש לבדיקת הומור ב-AI
מחקר
2 דקות
מ־arXiv cs.AI

Oogiri-Master: בנצ'מרק חדש לבדיקת הומור ב-AI

האם מודלי שפה גדולים יכולים להיות מצחיקים כמו בני אדם? Oogiri-Master הוא בנצ'מרק חדש המבוסס על משחק יפני, עם 100 תגובות לכל נושא ודירוגים עצמאיים. מודלים מתקדמים מתקרבים לביצועי אדם. קראו עכשיו על התובנות לשוניות והשיפורים! (112 מילים)

קרא עוד
LocalSearchBench: בנצ'מרק חדש לבדיקת חיפוש אג'נטי בשירותים מקומיים
מחקר
2 דקות
מ־arXiv cs.AI

LocalSearchBench: בנצ'מרק חדש לבדיקת חיפוש אג'נטי בשירותים מקומיים

חוקרים השיקו את LocalSearchBench, בנצ'מרק חדש לבדיקת חיפוש אג'נטי בשירותי חיים מקומיים. אפילו מודלים מתקדמים משיגים רק 34% הצלחה. קראו על האתגרים והמשמעויות לעסקים. קראו עכשיו!

קרא עוד