בעידן שבו סוכנים חכמים ממומשים עומדים להתפרס בסביבות ביתיות מגוונות, בדיקה מותאמת לכל סביבה תלת-ממדית חדשה הפכה לתנאי הכרחי. אולם, בנצ'מרקים קיימים סובלים מזיהום נתונים חמור ומחוסר ספציפיות סביבתית, שאינם מתאימים להערכת יכולות סוכנים בסביבות לא נראות. כדי להתמודד עם אתגר זה, חוקרים מציעים שיטת יצירת משימות דינמית במקום (in-situ) עבור סביבות לא נראות, בהשראת תהליכי חשיבה אנושיים. המערכת, המכונה TEA, מבוססת על ייצוג גרף מובנה ומשלבת שלב אינטראקציה ושלב אבולוציה.
בשלב האינטראקציה, הסוכן מתקשר באופן פעיל עם הסביבה, ויוצר לולאה בין ביצוע משימות ליצירתן, המאפשרת יצירה רציפה של משימות חדשות. בשלב האבולוציה, מודל הגרף של משימות מאפשר לשלב מחדש ולשנות שימוש במשימות קיימות כדי לייצר משימות חדשות ללא צורך בנתונים חיצוניים. השיטה הזו מבטיחה יצירת משימות רלוונטיות ומגוונות המותאמות בדיוק לסביבה הספציפית, ללא זיהום מנתונים ציבוריים.
ניסויים ב-10 סצנות תלת-ממדיות לא נראות הראו כי TEA יצרה אוטומטית 87,876 משימות בשני מחזורים בלבד. בדיקה אנושית אישרה כי המשימות סבירות פיזית ומכסות יכולות קוגניטיביות יומיומיות חיוניות. בנצ'מרקינג של מודלים מתקדמים (SOTA) מול בני אדם במשימות אלה חשף תוצאות מדאיגות: המודלים, שמצטיינים בבנצ'מרקים ציבוריים, נכשלים במשימות תפיסה בסיסיות.
המודלים חסרים מודעות אינטראקציה תלת-ממדית ומגיבים ברגישות גבוהה לסוגי משימות בשלב ההיגיון. ממצאים אלה מדגישים את הצורך בבדיקות במקום לפני פריסה בסביבות אנושיות אמיתיות. בהשוואה לשיטות קיימות, TEA מציעה גישה ייחודית שאינה תלויה בנתונים חיצוניים, מה שהופך אותה לכלי חיוני לפיתוח סוכנים אמינים יותר. בישראל, שבה חברות AI כמו Mobileye משקיעות בסוכנים אוטונומיים, שיטה זו יכולה לשפר בדיקות סביבתיות מקומיות.
הממצאים מעלים שאלות קריטיות למנהלי עסקים: האם סוכני ה-AI שלכם מוכנים לסביבות בלתי צפויות? TEA מציעה דרך אוטומטית לבדוק זאת, ומדגישה את הפער בין ביצועים במבחנים סטנדרטיים לבין מציאות. מומלץ לשלב גישות כאלה בפיתוח כדי להבטיח אמינות גבוהה יותר.