האם עידן מודלי היסוד הגדולים (LLMs) ומודלי ויז'ן-לשון (VLMs) באמת מחליף את למידת המכונה הקלאסית בסיווג רפואי? מחקר חדש שפורסם ב-arXiv בוחן זאת לעומק באמצעות ארבעה מערכי נתונים ציבוריים, המשלבים טקסט ותמונות במשימות בינאריות ומעמדות. התוצאות מפתיעות: שיטות למידת מכונה מסורתיות עולות על כולן ברוב המקרים.
המחקר השווה שלוש קבוצות מודלים: שיטות קלאסיות כמו רגרסיה לוגיסטית (LR), LightGBM ו-ResNet-50; מודלי LLM/VLM מבוססי פרומפטים כמו Gemini 2.5 ללא אימון; ומודלים מותאמים ב-PEFT (LoRA על גרסאות Gemma3). כל הניסויים השתמשו בפיצולים עקביים של נתונים ומדדי ביצועים אחידים. לפי הדיווח, מודלי ML הקלאסיים הציבו רף גבוה והשיגו את הביצועים הטובים ביותר ברוב משימות הסיווג הרפואי, במיוחד במערכי נתונים מבוססי טקסט מובנה.
לעומת זאת, גרסאות Gemma3 המותאמות ב-LoRA הראו ביצועים גרועים ביותר בכל הניסויים על טקסט ותמונות, ולא הצליחו להתכוונן מהאימון המינימלי. מודלי Gemini 2.5 בזירו-שוט הראו תוצאות מעורבות: ביצועים חלשים במשימות טקסט, אך תחרותיים במשימת תמונות מעמדות, שווים ל-ResNet-50 הבסיסי. המחקר מדגיש כי מודלי יסוד אינם עליונים תמיד, ושיעילות PEFT תלויה באסטרטגיית ההתאמה.
מדוע שיטות ML מסורתיות מנצחות? הן מצטיינות במשימות מובנות עם נתונים מוגבלים, בניגוד למודלי יסוד שדורשים כוונון מדויק. בסיווג רפואי, שבו דיוק קריטי ונתונים רגישים, אמינות הקלאסיים הופכת למפתח. בהקשר ישראלי, חברות מד-טק כמו אלו בתל אביב יכולות להרוויח משילוב חכם: ML קלאסי לבסיס, יסודיים למשימות מורכבות יותר.
המסקנה ברורה: אל תמהרו לזרוק את כלי ה-ML הוותיקים. עבור מנהלי עסקים רפואיים, כדאי לבחון שילובים היברידיים ולבדוק ביצועים ספציפיים. המחקר קורא לבחינה מחודשת של אסטרטגיות AI – האם הגעתם למודל היסודי הנכון?