בעידן שבו מודלי שפה גדולים (LLM) נבחנים בסביבות אינטראקטיביות לבדיקת אינטליגנציה חברתית, מחסומי תקשורת מציאותיים חושפים פער משמעותי. המחקר החדש מציג את SocialVeil, סביבת למידה חברתית שמדמה אינטראקציות תחת מחסומים הנובעים מהבדלים קוגניטיביים. סביבה זו מבוססת על סקירת ספרות שיטתית של אתגרי תקשורת באינטראקציות אנושיות, ומביאה את הבדיקה קרוב יותר למציאות. האם LLM יכולים לשמור על שיחה תחת עמימות סמנטית או התנגשות תרבותית? SocialVeil בודקת זאת.
SocialVeil מציגה שלושה סוגי מחסומים מייצגים: עמימות סמנטית, התאמת תרבות-חברה לא נכונה והפרעה רגשית. סביבה זו מאפשרת לבחון כיצד LLM מתמודדים עם תקשורת לא אידיאלית, בניגוד לבנצ'מרקים קיימים שמניחים תקשורת מושלמת. בנוסף, המחקר מציג שני מדדי הערכה חדשים המותאמים למחסומים: 'בלבול לא פתור' ו'הבנה הדדית', שמודדים את איכות האינטראקציה תחת תנאים לקויים.
בניסויים על 720 תרחישים עם ארבעה מודלי LLM מתקדמים, SocialVeil חשפה פגיעות משמעותיות. מחסומי התקשורת הורידו את ההבנה ההדדית ביותר מ-45% בממוצע, והעלו את הבלבול בכמעט 50%. הערכות אנושיות אישרו את נאמנות הדמיות אלו, עם ICC של כ-0.78 ו-Pearson r של כ-0.80. התוצאות מדגישות כי LLM נכשלים בסביבות ריאליסטיות יותר.
המשמעות העסקית של SocialVeil גדולה: חברות ישראליות המפתחות AI לשירות לקוחות או צ'טבוטים חייבות לבחון מערכותיהן בתנאי תקשורת לא מושלמים. הבנצ'מרק החדש מאפשר זיהוי חולשות מוקדם, ומשווה בין מודלים תחרותיים. בהשוואה לבנצ'מרקים אחרים, SocialVeil קרובה יותר לאתגרים אמיתיים כמו שיחות רב-תרבותיות בשוק הגלובלי.
אסטרטגיות הסתגלות כמו 'הוראות תיקון' ולמידה אינטראקטיבית השפיעו באופן מתון בלבד, רחוק מביצועים ללא מחסומים. SocialVeil פותחת דלת לחקירת אינטליגנציה חברתית אמיתית של סוכני LLM, ומזמינה פיתוח שיטות חדשות. מנהלי טכנולוגיה בישראל: כיצד תבדקו את ה-LLM שלכם בסביבה מציאותית? קראו את המחקר המלא ב-arXiv.