בעידן שבו מודלי שפה גדולים (LLMs) שולטים במשימות כלליות, הם נכשלים לעיתים קרובות בהזיות כשמדובר בידע ספציפי לתחום או ארגון שאינו קיים באימון הראשוני שלהם. חוקרים מציגים כעת שיטת זיקוק ידע מבוססת תגובות offline שמאפשרת לפתח עוזרים מיוחדים מדויקים מאוד במשאבי חומרה מוגבלים. השיטה נבחנה בשלוש אסטרטגיות נתונים: התאמה כללית (15,000 שורות), הזרקת ידע לא מובנה (2,000 שורות), ומאגר סינתטי מודע להקשר (500 שורות) שיוצר מודל מורה. המחקר מדגיש כיצד איכות הנתונים גוברת על הכמות.
השיטה מבוססת על זיקוק ידע מבוסס תגובות offline, שבה מודל תלמיד לומד מתגובות של מודל מורה ללא צורך באינטראקציה מקוונת. החוקרים השתמשו בספריית Unsloth כדי לייעל את מודל התלמיד Qwen-2.5-7B, ולהפחית את דרישות הזיכרון של כרטיס NVIDIA A100 מ-40 GB ל-16 GB בלבד. זאת מאפשרת אימון על חומרה נגישה יותר לעסקים קטנים ובינוניים. התוצאות מראות כי מאגרי נתונים גדולים ולא מובנים סובלים מהזיות מתמשכות, בעוד המאגר הקטן והמודע להקשר מצליח.
בניסויים, מאגר הנתונים הסינתטי המודע להקשר עם 500 שורות בלבד השיג דיוק של 96.7% ויכולת דחייה חזקה של שאלות מחוץ לתחום. לעומת זאת, אסטרטגיות עם נתונים גדולים יותר לא הצליחו להפחית הזיות באופן משמעותי. הממצאים מאמתים את השערת LIMA, שטוענת כי איכות ואליגורמות מבניות חשובות יותר מכמות הנתונים בהתאמה לתחום בסביבות משאבים נמוכים. זיקוק ידע זה פותח דלת להתמחות דומיין יעילה.
המשמעות העסקית בולטת במיוחד בישראל, שם חברות הייטק רבות זקוקות לעוזרים AI מותאמים אישית ללא תקציבי ענק. השיטה מאפשרת ליצור מודלים מיוחדים לידע פנימי או תחומי נישה כמו פינטק, בריאות או ביטחון, מבלי להסתמך על ענן יקר. בהשוואה לשיטות מקוונות, הגישה ה-offline חוסכת בעלויות תפעוליות ומגבירה פרטיות נתונים, מה שרלוונטי לתקנות GDPR ולחוק הגנת הפרטיות המקומי.
למנהלי עסקים, המסקנה ברורה: השקיעו באיכות נתונים מובנים ולא בכמות. השיטה מוכיחה שניתן להשיג תוצאות מצוינות עם מאגרים קטנים אם הם מותאמים היטב. בעתיד, נראה יותר כלים כאלה שידמו את Unsloth, שיהפכו התמחות דומיין לנגישה לכולם. מה תחום הדומיין הבא שתתמחו בו?