בעידן שבו סוכני AI מבצעים משימות מורכבות על שולחנות עבודה ומדפדפנים, מודלי ראייה-שפה הופכים לכלי מרכזי באוטומציה. אולם, בעוד מערכות מבוססות מסגרות מובילות בביצועים, פוליסות קצה-לקצה קלות יותר לפריסה מפגרות במבחנים כמו OSWorld-Verified. חוקרים מציגים כעת את BEPA – Bi-Level Expert-to-Policy Assimilation – שיטה המשלבת מסלולי מומחים קיימים באופן יעיל כדי לשפר פוליסות כאלה באמצעות למידה מחוזקת מתגמולים ניתנים לאימות (RLVR).
האתגר המרכזי במאגרי נתונים כמו OSWorld נובע ממספר מצומצם של משימות אינטראקטיביות ניתנות לאימות – כמה מאות בלבד – ומהצורך לאסוף מסלולים על ידי אינטראקציה עם הסביבות הללו, מה שמקשה על הרחבת הנתונים. שילוב ישיר של מסלולי מומחים off-policy בתהליך RLVR on-policy גורם לקשיים עקב אי התאמה מבנית והסטת הפצה. BEPA פותרת זאת בשתי רמות: רמה 1 מייצרת מסלולים נגישים תחת הפוליסה הבסיסית באופן עצמי, ורמה 2 משתמשת במטמון דינמי מעודכן למשימה ספציפית במהלך RLVR.
בניסויים על מבחן OSWorld-Verified, BEPA משפרת את שיעור ההצלחה של מודל UITARS1.5-7B מ-22.87% ל-32.13%, ועל קבוצת בדיקה נפרדת מ-5.74% ל-10.30%. השיפורים עקביים גם במבחנים MMBench-GUI ו-Online-Mind2Web, מה שמעיד על יעילות השיטה בסביבות מגוונות. לפי הדיווח, הקוד והנתונים זמינים בגיטהאב.
שיטה זו רלוונטית במיוחד לעסקים ישראליים המפתחים כלי אוטומציה, שכן היא מאפשרת שימוש יעיל בנתונים מוגבלים להכשרת סוכנים חכמים יותר. בהשוואה לשיטות מסורתיות, BEPA מפחיתה את התלות באיסוף נתונים חדש ומאיצה את הפיתוח של סוכני מחשב שיכולים לבצע משימות מורכבות כמו ניווט אתרים או ניהול קבצים.
למנהלי טכנולוגיה, BEPA מצביעה על מגמה עתידית: שילוב חכם בין נתוני מומחים ללמידה עצמית יאפשר פריסה מהירה יותר של סוכני AI בעסקים. האם חברתכם מוכנה לשלב סוכנים כאלה? קוד BEPA זמין כעת לבדיקה.