בעידן שבו מודלי שפה גדולים משמשים כסימולטורים אנושיים לבדיקת מערכות שיחה וייצור נתוני אימון, עולה השאלה: כמה הם באמת דומים למשתמשים אמיתיים? הנחיות פשוטות כמו 'התנהג כמשתמש' מניבות לעיתים התבטאויות ארוכות ומשעממות. כדי לפתור זאת, מציגים החוקרים את MirrorBench – מסגרת בנצ'מרקים רבת עוצמה ומדעית להערכת סוכני פרוקסי של משתמשים אך ורק על פי דמיון להתבטאויות אנושיות, מנותקת לחלוטין מהצלחת משימות downstream.
MirrorBench בנויה כמנוע ביצוע מודולרי עם ממשקים ממוינים, רישומי נתונים מונעי מטא-דאטה, תמיכה במספר גביים, מטמון ומעקב מפורט. המערכת מאפשרת חיבור קל של סוכני משתמשים שונים, מערכי נתונים, משימות ומדדי הערכה. החוקרים כללו שלושה מדדים של גיוון לקסיקלי: MATTR, YULE'S K ו-HD-D, לצד שלושה מדדים מבוססי שופט LLM: GTEval, Indistinguishability זוגית ו-Rubric-and-Reason. כלים אלה מאפשרים השוואה מדויקת בין תפוקות AI להתנהגות אנושית אמיתית.
בבדיקות על ארבעה מערכי נתונים פתוחים, MirrorBench חשפה פערים שיטתיים בין סוכני הפרוקסי למשתמשים אנושיים אמיתיים, תוך מתן תוצאות מודעות לווריאנס. המסגרת פתוחה לקוד ומספקת ממשק שורת פקודה פשוט לניהול ניסויים, תצורות, מטמון ודוחות. ניתן לגשת אליה בכתובת https://github.com/SAP/mirrorbench.
משמעות MirrorBench לעולם המחקר והפיתוח ב-AI היא עצומה. מנהלי טכנולוגיה בישראל ובחברות גלובליות יכולים כעת לבדוק בקלות אם סימולטורים שלהם מייצרים נתונים איכותיים, מה שמשפר את איכות האימון של מודלים. בהשוואה לכלים קיימים, MirrorBench מתמקדת בדמיון אנושי טהור, מה שמאפשר שיפורים ממוקדים בביצועי סוכנים.
לסיכום, MirrorBench מציעה דרך חדשנית להבטיח שסוכני משתמשים ב-AI יהיו מציאותיים יותר. מה תעשו כדי לשפר את הבדיקות שלכם? התחילו עם הכלי הזה עוד היום.