TOPIC

ICLR

כל החדשות והניתוחים שלנו בנושא ICLR — מתורגמים ומסוכמים ממקורות מובילים בעולם, עם הקשר עסקי ישראלי. 3 כתבות.

ReasoningBank לסוכני AI מתמשכים: איך זיכרון כישלונות משפר ביצועים
ניתוח
6 דקות
מ־Google Research

ReasoningBank לסוכני AI מתמשכים: איך זיכרון כישלונות משפר ביצועים

**ReasoningBank הוא מסגרת זיכרון לסוכני AI שמאפשרת להם ללמוד גם מהצלחות וגם מכישלונות אחרי הפריסה.** לפי Google Cloud, הגישה שיפרה ב-8.3% את התוצאות ב-WebArena וב-4.6% ב-SWE-Bench-Verified לעומת סוכן ללא זיכרון. עבור עסקים בישראל, המשמעות היא שסוכן שפועל ב-WhatsApp, ב-CRM או במערכות תפעול יכול לצבור לקחים במקום לחזור על אותן שגיאות. זה רלוונטי במיוחד למרפאות, משרדי עורכי דין, נדל"ן וחנויות אונליין, שבהם כל טעות חוזרת עולה בזמן צוות ובהזדמנויות מכירה. המבחן המעשי אינו אם יש לכם מודל טוב, אלא אם יש לכם מנגנון ששומר נימוקים, כישלונות והחלטות שניתנות למחזור בתהליך הבא.

קרא עוד
ResearchGym למחקר אוטונומי: למה סוכני AI עדיין לא חוקרים לבד
מחקר
6 דקות
מ־arXiv cs.AI

ResearchGym למחקר אוטונומי: למה סוכני AI עדיין לא חוקרים לבד

**ResearchGym מראה שסוכני בינה מלאכותית עדיין לא אמינים מספיק למחקר אוטונומי מלא.** לפי המאמר, סוכן מבוסס GPT-5 שיפר תוצאות רק ב-1 מתוך 15 הערכות והשלים בממוצע 26.5% מתתי-המשימות. עבור עסקים בישראל, זו תזכורת חשובה: לא בונים תהליך קריטי על Agent לבדו. המסקנה המעשית היא להטמיע סוכנים בתוך ארכיטקטורה מבוקרת — למשל שילוב של WhatsApp Business API, ‏Zoho CRM ו-N8N — עם כללי הרשאה, לוגים ו-fallback אנושי. כך אפשר ליהנות ממהירות ויכולת ניסוח של AI בלי לשלם מחיר תפעולי על טעויות לא צפויות.

קרא עוד