פער ההערכה ברפואה וב-AI: מסגרת הסתברותית חדשה לאי ודאות
מחקר

פער ההערכה ברפואה וב-AI: מסגרת הסתברותית חדשה לאי ודאות

מחקר חושף כיצד אי ודאות באמת המידה מטעה הערכות של מודלי שפה גדולים ומודלי ראייה, וממליץ על שכבתיות תוצאות

2 דקות קריאה

תקציר מנהלים

נקודות עיקריות

  • הערכות סטנדרטיות מתעלמות מאי ודאות בתשובות מומחים, מה שמוביל למסקנות שגויות.

  • מסגרת הסתברותית מציגה דיוק ו-F1 צפויים בהתחשב בווריאציה.

  • שכבת תוצאות לפי שיעור הסכמה – קריטי מתחת ל-80% ביצועים.

פער ההערכה ברפואה וב-AI: מסגרת הסתברותית חדשה לאי ודאות

  • הערכות סטנדרטיות מתעלמות מאי ודאות בתשובות מומחים, מה שמוביל למסקנות שגויות.
  • מסגרת הסתברותית מציגה דיוק ו-F1 צפויים בהתחשב בווריאציה.
  • שכבת תוצאות לפי שיעור הסכמה – קריטי מתחת ל-80% ביצועים.
בעולם הרפואה, שבו אפילו מומחים מסכימים רק חלקית על אבחנות ותשובות, האם ניתן לסמוך על בנצ'מרקים של מערכות בינה מלאכותית? מחקר חדש שפורסם ב-arXiv חושף פער הערכה קריטי בבדיקת יכולות מודלי שפה גדולים (LLMs) ומודלי ראייה. לפי החוקרים, הערכות סטנדרטיות מתעלמות מאי הוודאות באמת המידה שמספקים המומחים, מה שמוביל למסקנות מטעות. המחקר מציג מסגרת הסתברותית שמסבירה מדוע ודאות גבוהה באמת המידה היא תנאי הכרחי להשגת ציונים גבוהים, אפילו עבור מומחים. המסגרת ההסתברותית מוכיחה כי ברפואה, שבה אי ודאות שכיח, פער ההערכה מתרחב. כשיש וריאציה גבוהה בתשובות המומחים, ההפרש בביצועים בין תייגר אקראי למומחי עילית הופך זניח. החוקרים מדגישים כי התעלמות מאי הוודאות עלולה לגרום לכך שמערכת לא מומחית תיראה כאילו היא מתחרה ברמה של מומחה. כדי להתמודד עם הבעיה, הם מציגים מושגים חדשים: דיוק צפוי ו-F1 צפוי, שמעריכים את הציון האפשרי של מומחה או מערכת בהתחשב בווריאציה באמת המידה. ההמלצה המרכזית של המחקר היא לשכבת את תוצאות ההערכה לפי הסתברות האמת המידה, שנמדדת משיעור ההסכמה בין מומחי האמת המידה. שיטה זו הופכת קריטית במיוחד כשהביצועים הכוללים יורדים מתחת ל-80%. בדלדלים של ודאות גבוהה, ההשוואה בין מערכות הופכת אמינה יותר ומפחיתה את השפעת גורם הבלבול העיקרי – אי הוודאות עצמה. פער ההערכה הזה רלוונטי במיוחד לרפואה, שבה החלטות חיים תלויות בדיוק. בהשוואה לשיטות מסורתיות, הגישה ההסתברותית מאפשרת הבחנה טובה יותר בין מערכות טובות לפחות טובות. בישראל, שבה חברות רבות מפתחות AI רפואי, חשוב לאמץ שיטות כאלה כדי להימנע מהטיות בבחירת כלים. זה משפיע גם על פיתוח מודלים מקומיים. עבור מנהלי עסקים ומהנדסי AI, המסקנה ברורה: התחילו לשכבת תוצאות בבנצ'מרקים שלכם, במיוחד מתחת ל-80% דיוק. כיצד תשנו את תהליך ההערכה שלכם היום כדי להבטיח החלטות מבוססות יותר? המחקר מדגיש את הצורך בגישה מדעית מדויקת יותר להערכת AI.

שאלות ותשובות

שאלות נפוצות

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

המידע שתמסור ישמש ליצירת קשר ומתן שירותים. למידע נוסף ראה מדיניות פרטיות ותנאי שימוש

עוד כתבות שיעניינו אותך

לכל הכתבות
זיהוי עמימות הוראות 3D: פריצת דרך בבטיחות AI
מחקר
2 דקות

זיהוי עמימות הוראות 3D: פריצת דרך בבטיחות AI

החוקרים בנו את Ambi3D, מאגר הנתונים הגדול ביותר למשימה זו עם למעלה מ-700 סצנות 3D מגוונות וכ-22 אלף הוראות. ניתוח מראה שמודלי שפה גדולים 3D מתקדמים נכשלים בזיהוי אמין של עמימות. כדי להתמודד עם האתגר, הם מציעים את AmbiVer – מסגרת דו-שלבית שאוספת ראיות חזותיות ממספר זוויות ומנחה מודל שפה-ראייה לשיפוט העמימות. ניסויים מקיפים מוכיחים את יעילות AmbiVer ומדגישים את קושי המשימה.

Ambi3DAmbiVerarXiv
קרא עוד