בעידן הדיגיטלי שבו מודלי שפה גדולים (LLMs) משולבים במנועי חיפוש, מערכות המלצה ושירותי שיחה, אמינות נתפסת היא המפתח לניווט מידע מקוון. אך האם מודלים אלה מייצגים את המושג הזה בצורה פסיכולוגית עקבית? מחקר חדש שפורסם ב-arXiv בוחן זאת ומגלה כי מודלים כמו Llama 3.1 8B, Qwen 2.5 7B ו-Mistral 7B מקודדים אותות אמינות באופן מרומז בטקסטים דמויי אינטרנט.
החוקרים ניתחו את הייצוגים הפנימיים של המודלים באמצעות מערך PEACE-Reviews, שנתון תחת סימון להערכות קוגניטיביות, רגשות וכוונות התנהגותיות. הם גילו הבדלים שיטתיים בפעילויות בשכבות ובראשי-הקשב (heads) בין טקסטים בעלי אמינות גבוהה לנמוכה. אותות אלה ניתנים לפענוח ליניארי, מה שמעיד על קידוד מרומז במהלך האימון הראשוני (pretraining), ללא השגחה מפורשת.
ניתוחי עומק הראו כי אימון ההוראות (instruction-tuning) מחדד את הייצוגים הללו מבלי לשנות את מבנהם הבסיסי. הקשרים החזקים ביותר נמצאו עם הערכות של הוגנות, ודאות ואחריות-עצמית – ממדים מרכזיים בתהליך יצירת אמון אנושי באינטרנט. לפי הדיווח, הדבר מוכיח כי LLMs מודרניים מפנימים אותות אמינות מבוססי פסיכולוגיה באופן טבעי.
משמעות הממצאים עולה כשחושבים על שילוב LLMs במערכות אינטרנטיות: הם מספקים בסיס לייצוגי אמון פסיכולוגיים, שיכולים לשמש לתכנון מערכות AI שקופות ואמינות יותר. בהשוואה למודלים קודמים, כאן מדובר בקידוד אוטומטי שמאפשר התאמה לעולם העסקי, כמו המלצות מותאמות אישית או חיפושים מדויקים.
למנהלי עסקים ישראליים המאמצים AI, המחקר מצביע על פוטנציאל לבניית אמון במשתמשים דרך ניצול אותות אלה. כיצד זה ישפיע על פלטפורמות מקומיות? קוד ומסמכים זמינים ב-GitHub.