מסגרת AIR: בטיחות סוכני AI בתגובה לאירועים
מחקר חדש מציג את AIR, מסגרת ראשונה לתגובה לאירועים בסוכני LLM, עם הצלחה של 90%+. גלו כיצד זה משפר בטיחות אוטומציה עסקית.
קרא עודAgentNoiseBench: בנצ'מרק חדש לבדיקת סוכני LLM ברעש
מחקר חדש מציג AgentNoiseBench לבדיקת עמידות סוכני LLM ברעש. התוצאות חושפות רגישות גבוהה – מה זה אומר לעסקים? קראו עכשיו.
קרא עודPreFlect: השתקפות מראש לסוכני שפה גדולים
מחקר חדש מציג PreFlect, מנגנון השתקפות פרוספקטיבית שמשפר סוכני LLM על ידי ביקורת תוכניות מראש. שיפור משמעותי בביצועים – כדאי לבדוק!
קרא עודAIRS-Bench: בנצ'מרק חדש לסוכני AI במחקר מדעי
AIRS-Bench בודק סוכני AI על 20 משימות מחקר מתקדמות. סוכנים מצליחים ב-4 מתוכן. גלו את הפוטנציאל לעסקים. [קראו עכשיו](/services/ai-agents)
קרא עודPieArena: סוכני שפה גדולים משיגים משא ומתן ברמת MBA
האם AI יכול לנהל משא ומתן כמו MBA? PieArena חושף ש-GPT-5 מתעלה על סטודנטים. קראו עכשיו על הביצועים המהפכניים!
קרא עודמודלינג אי-ודאות ניתנת להפחתה לסוכני LLM אמינים
סוכני LLM זקוקים לכימות אי-ודאות מתקדם. מאמר חדש מציע מסגרת חדשה שמתמקדת בהפחתת אי-ודאות אינטראקטיבית. קראו עכשיו להבין כיצד זה משפיע על יישומי AI עסקיים.
קרא עודAutoRefine: שיפור סוכני LLM מתמשך מניסיון
בעולם שבו סוכני דגמי שפה גדולים נתקלים במשימות חדשות ללא למידה מניסיון, AutoRefine משנה את חוקי המשחק עם חילוץ דפוסי ניסיון דואליים ותחזוקה רציפה. תוצאות: 98.4% ב-ALFWorld ועד 27.1% ב-TravelPlanner. קראו עכשיו!
קרא עודYoutu-Agent: מסגרת חדשה לשיפור סוכני LLM
בעידן שבו סוכני שפה גדולים (LLM) סובלים מעלויות הגדרה גבוהות, מציגים חוקרים את Youtu-Agent – מסגרת שמאפשרת יצירה אוטומטית ושיפור רציף. קראו עכשיו על התוצאות המדהימות בבנצ'מרקים.
קרא עודTravelBench: בנצ'מרק חדש לסוכני AI בתכנון טיולים
בעידן שבו סוכני שפה גדולים (LLM) מבטיחים להפוך את התכנון היומיומי לקל יותר, האם הם באמת מסוגלים להתמודד עם משימות מורכבות כמו תכנון טיול? TravelBench, בנצ'מרק חדש שפורסם ב-arXiv, בודק זאת לעומק. קראו עכשיו על הבנצ'מרק שמשנה את כללי המשחק.
קרא עודבקרת השתקפות: פתרון חדש לביטחון סוכני קוד AI
בעידן שבו סוכני שפה גדולים מציגים יכולות מרשימות אך חסרי בקרות ביטחון, חוקרים מציגים 'בקרת השתקפות' – מודול שמשלב ניטור עצמי בתהליך החשיבה. קראו את הניתוח המלא! (85 מילים)
קרא עודמתרואידים להתאמה אישית: שיטה חדשה לסוכני LLM מינימליים
בעידן סוכני LLM, מחקר חדש מציג שימוש במתרואידים להתאמה אישית מובנית תחת מגבלות מורכבות, למזעור חשיפת נתונים. קראו כיצד זה משנה את כללי המשחק בעסקים.
קרא עודמסגרת חדשה לסוכני LLM אמינים במשימות רב-תוריות
מודלי שפה גדולים חזקים אך לא אמינים במשימות רב-תוריות. מסגרת חדשה ב-arXiv משלבת פרופיילר, חשיבה ויצירה מבוקרת להשגת אמינות. קראו על ההתפתחות המשותפת של הרכיבים.
קרא עודסוכני LLM מאטומטים ניתוח נתונים בפיזיקת חלקיקים
חוקרים פיתחו סוכני LLM שמאטומטים ניתוח נתונים בפיזיקת חלקיקים, כולל מדידת Higgs ב-ATLAS. המערכת ההיברידית משלבת AI עם Snakemake לביצוע אוטונומי. קראו על הממצאים המהפכניים. (48 מילים)
קרא עוד