בעידן מודלי השקה גדולים שדורשים כוח חישוב עצום, הבעיה המרכזית היא מטמון ה-KV שגדל ליניארית עם תהליך שרשרת המחשבה (CoT) המפורט. זה גורם לבזבוז זיכרון ולצוואר בקבוק במהירות. חוקרים מציגים את SkipKV – שיטת כיווץ KV ללא אימון שפועלת ברמת משפטים. הפתרון מזהה משפטים דומים מאוד, מסיר אותם תוך שמירה על קוהרנטיות סמנטית, ומשתמש בווקטור הנחיה כדי להפחית יצירה מיותרת.
SkipKV בוחנת את שיטות הפינוי הקיימות ומגלה שהן נכשלות בסביבת multi-batch בגלל ציונים לא יציבים וטוקנים מרופדים שמקטינים את תקציב ה-KV האפקטיבי. בנוסף, הן מייצרות רצפים ארוכים יותר בגלל חזרות במהלך ההסקה. SkipKV פועלת ברמת משפט גסה: מדד ציון משפט מזהה ומסיר משפטים דומים, מה שמאפשר כיווץ יעיל יותר.
כדי למנוע יצירה ארוכה מדי, SkipKV מעדכנת מצבים נסתרים בזמן אמת באמצעות ווקטור הנחיה דינמי, שמאלץ את המודל לייצר תשובות תמציתיות. זה מבטיח שההסקה נשארת קצרה וממוקדת, תוך שמירה על איכות.
בבחנים מרובים להסקה, SkipKV משיגה עד 26.7% שיפור בדיוק בהשוואה לשיטות מתחרות, באותו תקציב כיווץ. היא מפחיתה אורך יצירה ב-1.6 פעמים ומרימה throughput ב-1.7 פעמים בהשוואה ל-SoTA. זה רלוונטי במיוחד לעסקים ישראליים שמפתחים יישומי AI מקומיים, שם יעילות זיכרון קריטית להטמעה בענן.
SkipKV מציעה פתרון פשוט ויעיל לפריסת מודלי הסקה גדולים. מנהלי טכנולוגיה צריכים לבדוק אותה ליישומים כמו ניתוח נתונים או קבלת החלטות אוטומטית, כדי להוזיל עלויות תפעול.