בעידן שבו מודלי שפה גדולים (LLM) רפואיים תופסים מקום מרכזי בחינוך מטופלים, טריאז' וקבלת החלטות קליניות ברפואת עיניים, חשוב לבחון אותם בקפידה כדי להבטיח בטיחות ודיוק. מחקר חדש שפורסם ב-arXiv בדק ארבעה מודלים קטנים יחסית – Meerkat-7B, BioMistral-7B, OpenBioLLM-8B ו-MedLLaMA3-v20 – בתשובה לשאלות מטופלים בתחום העיניים. המטרה: לבחון את כשירותם לשימוש קליני ולבדוק אם הערכה מבוססת LLM יכולה להחליף דירוג של רופאים.
במחקר חתך, נאספו 180 שאלות נפוצות של מטופלים ברפואת עיניים, וכל מודל סיפק תשובות לכל אחת מהן – סה"כ 2,160 תגובות. המודלים נבחרו בגלל גודלם הקטן (פחות מ-10 מיליארד פרמטרים), המאפשר פריסה יעילה מבחינת משאבים. התשובות נבחנו על ידי שלושה רופאי עיניים בשלבים שונים של ותק – יועץ בכיר, יועץ ותושב – ועל ידי GPT-4-Turbo, באמצעות מסגרת S.C.O.R.E. שמעריכה בטיחות, הסכמה והקשר, אובייקטיביות, שרשרתיות והסבריות, בדירוג Likert מחמישה נקודות.
Meerkat-7B זכה לציונים הגבוהים ביותר: 3.44 מיועץ בכיר, 4.08 מיועץ ו-4.18 מתושב. לעומת זאת, MedLLaMA3-v20 ביצע הגרוע ביותר, עם 25.5% תגובות שכללו הזיות או תוכן מטעה קלינית, כולל מונחים מומצאים. שאר המודלים – BioMistral-7B ו-OpenBioLLM-8B – הציגו ביצועים בינוניים, אך פחות טובים מ-Meerkat.
הערכת GPT-4-Turbo התאמה היטב לדירוגי הרופאים, עם מתאם ספרמן של 0.80 ומתאם קנדל טאו של 0.67. יועץ הבכיר דירג בצורה שמרנית יותר, אך בסך הכל, ההסכמה הייתה גבוהה. זה מצביע על היתכנות של הערכה אוטומטית מבוססת LLM לבדיקות בקנה מידה גדול.
המחקר מראה כי LLM רפואיים קטנים בעלי פוטנציאל לתמיכה בטוחה בשאלות מטופלים ברפואת עיניים, אך עדיין קיימים פערים בעומק קליני ובאחידות. עבור מנהלי בתי חולים ומפתחי אפליקציות רפואיות בישראל, זה מדגיש את הצורך במסגרות היברידיות המשלבות בדיקה אוטומטית וביקורת רופאים. כיצד תשלבו AI כזה בשגרה הקלינית שלכם?