חיפוש בחדשות

8 תוצאות עבור "Arena".

גוגל מציגה את TabFM: מודל יסוד לנתונים טבלאיים שישנה את ה-CRM
מחקר
4 דקות
מ־Google Research

גוגל מציגה את TabFM: מודל יסוד לנתונים טבלאיים שישנה את ה-CRM

חברת Google (גוגל) הציגה את TabFM (מודל יסוד לנתונים טבלאיים), פתרון בינה מלאכותית בשיטת Zero-Shot המאפשר ביצוע משימות סיווג ורגרסיה על נתונים מובנים ללא צורך באימון מודל מותאם אישית או אופטימיזציה מורכבת של היפר-פרמטרים. המודל פותח על ידי חוקרי Google Research (זרוע המחקר של גוגל) ואומן על מאות מיליוני נתונים סינתטיים המבוססים על מודלים סיבתיים מבניים. במבחני ביצועים שנערכו במערכת המדדים TabArena (פלטפורמת הערכה למודלים טבלאיים), המודל השיג תוצאות מובילות בהשוואה לאלגוריתמים מסורתיים כמו XGBoost (אלגוריתם למידת מכונה מבוסס עצי החלטה). המודל משוחרר כקוד פתוח ומשולב ישירות בתוך Google Cloud BigQuery לשימוש מהיר באמצעות פקודות SQL פשוטות.

קרא עוד
ReasoningBank לסוכני AI מתמשכים: איך זיכרון כישלונות משפר ביצועים
ניתוח
6 דקות
מ־Google Research

ReasoningBank לסוכני AI מתמשכים: איך זיכרון כישלונות משפר ביצועים

**ReasoningBank הוא מסגרת זיכרון לסוכני AI שמאפשרת להם ללמוד גם מהצלחות וגם מכישלונות אחרי הפריסה.** לפי Google Cloud, הגישה שיפרה ב-8.3% את התוצאות ב-WebArena וב-4.6% ב-SWE-Bench-Verified לעומת סוכן ללא זיכרון. עבור עסקים בישראל, המשמעות היא שסוכן שפועל ב-WhatsApp, ב-CRM או במערכות תפעול יכול לצבור לקחים במקום לחזור על אותן שגיאות. זה רלוונטי במיוחד למרפאות, משרדי עורכי דין, נדל"ן וחנויות אונליין, שבהם כל טעות חוזרת עולה בזמן צוות ובהזדמנויות מכירה. המבחן המעשי אינו אם יש לכם מודל טוב, אלא אם יש לכם מנגנון ששומר נימוקים, כישלונות והחלטות שניתנות למחזור בתהליך הבא.

קרא עוד
דירוג מודלי AI לארגונים: למה Arena הפכה לשופטת השוק
ניתוח
6 דקות
מ־TechCrunch

דירוג מודלי AI לארגונים: למה Arena הפכה לשופטת השוק

**Arena הפכה בתוך 7 חודשים מפרויקט דוקטורט ב-UC Berkeley לחברה בשווי 1.7 מיליארד דולר, משום שהיא מודדת בפועל מי מודל ה-AI שמקבל אמון שוק.** לפי TechCrunch, הפלטפורמה כבר משפיעה על השקות, גיוסים והחלטות רכש, וכעת מתרחבת גם למדידת סוכנים, קוד ומשימות מהעולם האמיתי. עבור עסקים בישראל, זה אומר שצריך להפסיק לבחור מודל לפי הייפ ולהתחיל לבחור לפי workflow: האם הוא מחובר ל-WhatsApp Business API, ל-Zoho CRM, ל-N8N, והאם הוא משפר KPI ברור כמו זמן תגובה, טיפול בלידים או דיוק במסמכים. השאלה החשובה אינה מי ראשון בטבלה, אלא מי מספק תוצאה עסקית אמינה בעברית, תחת רגולציה מקומית ובעלות סבירה.

קרא עוד
אימון יציב לסוכני LLM: מה מחקר ARLArena משנה
מחקר
5 דקות
מ־arXiv cs.AI

אימון יציב לסוכני LLM: מה מחקר ARLArena משנה

**אימון יציב לסוכני LLM הוא תנאי בסיסי להפיכת סוכן מבוסס AI ממדגים מרשימים לכלי עסקי שאפשר לסמוך עליו.** מחקר ARLArena מציג מסגרת בדיקה שיטתית ל-Agentic Reinforcement Learning ומציע את SAMPO, שיטה שמטרתה לצמצם קריסות באימון ולשפר עקביות במשימות מרובות שלבים. עבור עסקים בישראל, המשמעות מעשית: אם סוכן אמור לעדכן Zoho CRM, להפעיל תהליך ב-N8N ולשלוח הודעה ב-WhatsApp Business API, היציבות חשובה לא פחות מהדיוק. ההמלצה היא להתחיל בפיילוט מדיד, לבנות שכבת בקרה, ולבחון הצלחה לפי שיעור השלמת תהליך ולא רק לפי איכות התשובה.

קרא עוד
סוכני GUI עם זיכרון מצב: למה ActionEngine משנה את הכללים
ניתוח
6 דקות
מ־arXiv cs.AI

סוכני GUI עם זיכרון מצב: למה ActionEngine משנה את הכללים

**ActionEngine הוא כיוון חדש לסוכני GUI: במקום לנתח כל מסך מחדש, הוא בונה זיכרון מצב של הממשק ומייצר תוכנית Python מלאה לביצוע המשימה.** לפי המאמר, במבחן WebArena על משימות Reddit המערכת הגיעה ל-95% הצלחה, עם קריאת LLM אחת בממוצע, עלות נמוכה פי 11.8 וזמן ריצה קצר פי 2 לעומת בסיס חזותי מוביל. עבור עסקים בישראל, המשמעות חשובה במיוחד בתהליכים ללא API — למשל פורטלים של ביטוח, נדל"ן או הנהלת חשבונות. ההמלצה המעשית: למפות תהליכים ידניים, להעדיף API כשאפשר, ולבחון שכבת GUI עם זיכרון מצב כחלק מארכיטקטורה שמשלבת WhatsApp Business API, Zoho CRM ו-N8N.

קרא עוד
OpenDataArena: זירה פתוחה לבנצ'מרקינג מאגרי נתונים ל-LLM
מחקר
3 דקות
מ־arXiv cs.AI

OpenDataArena: זירה פתוחה לבנצ'מרקינג מאגרי נתונים ל-LLM

מודלי שפה גדולים תלויים באיכות הנתונים, אך אלה נותרים שקופים. OpenDataArena (ODA) משנה זאת עם פלטפורמה פתוחה להערכה הוגנת. קראו על ארבעת עמודי התווך, ניסויים עם 120 מאגרים ותובנות חדשות. גלו כיצד זה משפיע על עסקיכם.

קרא עוד