בעולם שבו מודלי שפה גדולים (LLM) משמשים כשופטים להערכת ביצועי סוכני AI, תהו אי פעם אם ההיגיון הפנימי של הסוכן אמיתי? מחקר חדש מ-arXiv חושף פרצה קריטית: שופטי LLM רגישים במיוחד להונאה באמצעות שכתוב שרשרת המחשבה (CoT) של הסוכן, מבלי לשנות פעולות או תצפיות. החוקרים הוכיחו זאת על פני 800 מסלולים מגוונים במשימות אינטרנט, מה שמעלה ספקות רציניים בשיטת ההערכה הזו.
הניסוי בוצע על ידי שכתוב שיטתי של שרשרת המחשבה תוך שמירה על הפעולות והתצפיות קבועות. התוצאות מדהימות: שופטי VLM מתקדמים, כמו GPT-4V, הגיבו בשיעורי שגיאה חיוביים כוזבים של עד 90%. אסטרטגיות ההונאה חולקו לשתי קטגוריות – מבוססות סגנון שמשנות רק את הניסוח, ומבוססות תוכן שמזייפות סימני התקדמות במשימה. ההונאות מבוססות תוכן היו יעילות יותר באופן עקבי, מה שמראה על חולשה יסודית בשופטי LLM.
המחקר בדק גם דרכי הגנה: שיפורי פרומפטינג והגברת כוח חישוב בשלב השיפוט מפחיתים את הרגישות, אך אינם מבטלים אותה לחלוטין. שופטי LLM ממשיכים להיות פגיעים להונאה, במיוחד בסביבות לא ניתנות לאימות שבהן ההערכה מבוססת על מסלולי הסוכן בלבד. זה מעלה שאלות על תקפות ההנחה הבסיסית ששרשרת המחשבה משקפת נאמנה את ההיגיון הפנימי ואת מצב הסביבה.
לעסקים ישראלים המפתחים סוכני AI אוטונומיים, התגלית הזו קריטית. הערכת ביצועים מדויקת חיונית להשקעות מוצלחות, אך אם שופטי LLM ניתנים להונאה בקלות, זה עלול להטעות החלטות אסטרטגיות. בהשוואה לשיטות מסורתיות, השופטים האוטומטיים האלה נוחים אך לא אמינים מספיק עדיין, במיוחד במשימות אינטרנט מורכבות כמו ניווט או חיפוש מידע.
המסקנה ברורה: יש צורך בשופטים שמאמתים טענות היגיון מול ראיות נצפות ממשיות. מנהלי טכנולוגיה צריכים לשקול שילוב אימות רב-שכבתי כדי להבטיח הערכות אמיתיות. מה תעשו כדי להגן על תהליכי הבדיקה שלכם?