האם מודלי שפה גדולים (LLM) מפלים בין אזורים גיאוגרפיים? מחקר חדש שפורסם ב-arXiv חושף הטיה אזורית חמורה במודלים מובילים כמו GPT ו-Claude, מה שמאיים על הוגנות היישומים הגלובליים שלהם. החוקרים פיתחו מסגרת הערכה בשם FAZE, המבוססת על 100 פרומפטים שנבנו בקפידה לבחירה כפויה בין אזורים בתרחישים ניטרליים לחלוטין. התוצאות מדהימות: GPT-3.5 קיבל ציון הטיה של 9.5 מתוך 10, בעוד Claude 3.5 Sonnet זכה בציון הנמוך ביותר – 2.5 בלבד. ממצאים אלה מדגישים את הצורך בהערכות מקיפות יותר.
המחקר בדק עשרה מודלי LLM בולטים: GPT-3.5, GPT-4o, Gemini 1.5 Flash, Gemini 1.0 Pro, Claude 3 Opus, Claude 3.5 Sonnet, Llama 3, Gemma 7B, Mistral 7B ו-Vicuna-13B. כל מודל נבחן באמצעות אותה סדרת פרומפטים, שמטרתה לחשוף נטייה להעדיף אזורים מסוימים ללא הצדקה תרבותית או הקשרית. FAZE מספקת ציון מ-0 עד 10, כאשר ציונים גבוהים יותר מעידים על הטיה חזקה יותר. לפי הדיווח, ההבדלים בין המודלים משמעותיים ומצביעים על רמות שונות של אימון והטיות נתונים.
תוצאות המחקר מראות וריאציה גדולה: GPT-3.5 בולט בהטיה הגבוהה ביותר (9.5), מה שמעלה שאלות על אמינותו בשימושים חוצי תרבויות. לעומת זאת, Claude 3.5 Sonnet מציג ביצועים מעולים עם 2.5, מה שמצביע על מאמצי פיתוח טובים יותר להפחתת הטיות. מודלים אחרים כמו Llama 3 ו-Mistral 7B נמצאו באמצע הסקאלה, אך עדיין חושפים חולשות פוטנציאליות.
הטיה אזורית עלולה לפגוע קשות באמינות, הוגנות והכללה של פלטי LLM ביישומים אמיתיים, במיוחד בעולם הגלובלי שבו משתמשים מרחבי העולם מסתמכים עליהם. המחקר מדגיש את החשיבות של מסגרות הערכה מכילות ושיטתיות לזיהוי והפחתת הטיות גיאוגרפיות. בישראל, שבה AI משמש לעסקים בינלאומיים, ממצאים אלה רלוונטיים במיוחד – מנהלים צריכים לבדוק מודלים לפני אימוץ.
מה המשמעות לעסקים? ארגונים שמשתמשים ב-LLM חייבים לשקול הטיות כאלה כדי למנוע החלטות מוטות. המחקר קורא לפיתוח כלים כמו FAZE כסטנדרט, ומזמין חוקרים ומפתחים לשפר את המודלים. האם נראה שיפור במודלים הבאים? קראו את המחקר המלא כדי להעריך את הכלים שלכם.