בעולם שבו סביבות דיגיטליות כמו האינטרנט משתנות בקצב מסחרר, סוכני AI המבוססים על מודלי ויז'ן-שפה (VLM) מתקשים להתאים את עצמם. כעת, מחקר חדש מציג פרדיגמה חדשה: Best-of-Q, שמשפרת את מדיניות הסוכנים בזמן אינפרנס ללא צורך באימון מחדש יקר. השיטה מפרידה בין תפקיד ה-VLM כמציע פעולות לבין מנגנון הבחירה הסופית, ומאפשרת שדרוג מיידי.
השיטה פועלת כך: ה-VLM נשאר קפוא ומציע קבוצת פעולות מועמדות למצב נתון. לאחר מכן, פונקציית Q קלה לאימון מחדש מדרגת את המועמדות ומבחרת את הפעולה בעלת הערך הגבוה ביותר. בניגוד לגישות מסורתיות שמשתמשות ב-Q לאימון מחדש, כאן היא מיושמת ישירות באינפרנס להשגת שיפור מיידי. החוקרים מדגימים זאת בבנצ'מרק WebVoyager האקדמי.
בבדיקות, השיטה העלתה את שיעור ההצלחה של סוכן Qwen2.5-VL-7B מ-38.8% ל-55.7%, שיפור של כמעט 17%. אפילו סוכן מתקדם כמו GPT-4.1 עלה מ-82.4% ל-88.8%. התוצאות מראות כי הגישה הזו יעילה במיוחד בסביבות משתנות כמו האינטרנט ומערכות הפעלה, שבהן fine-tuning מסורתי דורש איסוף נתונים ומשאבים רבים.
המשמעות העסקית גדולה: חברות ישראליות בתחום האוטומציה וה-AI יכולות לשפר סוכנים קיימים ללא השקעה כבדה באימון. זה רלוונטי במיוחד לסטארט-אפים שמפתחים כלים לאוטומציה של משימות אינטרנטיות, כמו מסחר אלקטרוני או ניהול תוכן. השיטה מאפשרת התאמה מהירה לשינויים, מה שנותן יתרון תחרותי.
לסיכום, Best-of-Q פותח דלת לשיפורים מהירים בסוכני VLM. מנהלי טכנולוגיה צריכים לבחון אינטגרציה של פונקציות Q כאלה במערכותיהם. האם זה הצעד הבא לעבר סוכנים אוטונומיים אמיתיים?