בעידן שבו מודלי שפה גדולים (LLMs) מתמודדים עם שאלות מורכבות באמצעות תכנון דינמי וחיפוש חיצוני, נחשפת בעיה קריטית: הסוכנים האג'נטיים מבוססי למידה מחוזקת (RL) נוטים לספק תשובות משכנעות אך לא אמינות כשהידע מוגבל. הם כמעט אף פעם לא מודים 'אני לא יודע' (IDK), מה שיוצר סיכונים רבים בתרחישים אמיתיים כמו ייעוץ רפואי או החלטות עסקיות. מחקר חדש מציג את BAPO – מסגרת למידה מחוזקת שמטפלת בדיוק בבעיה זו.
חיפוש אג'נטי מבוסס RL מאפשר למודלים לפתור בעיות מורכבות על ידי שילוב תכנון וחיפוש חיצוני, ומשפר משמעותית את הדיוק בזכות מדיניות סוכנים מותאמת בלמידה מחוזקת בקנה מידה גדול. עם זאת, לפי הדיווח, הסוכנים האלה נכשלים בזיהוי גבולות ההיגיון שלהם ומספקים תשובות סבירות אך שגויות כשהראיות חסרות או ההיגיון מגיע לקצה גבול היכולת. חוסר האמינות הזה עלול להוביל להחלטות מסוכנות בעולם האמיתי.
כדי להתגבר על הפער, מציעים החוקרים את Boundary-Aware Policy Optimization (BAPO), מסגרת RL חדשנית שמטפחת מודעות לגבולות ללא פגיעה בדיוק. BAPO כוללת שני רכיבים מרכזיים: (i) תגמול מודע לגבולות מבוסס קבוצות, שמעודד תגובה IDK רק כשההיגיון מגיע לקצו; ו-(ii) ממדל תגמול אדפטיבי שמקפיא את התגמול הזה בשלבים מוקדמים של חקירה, כדי למנוע ניצול IDK כקיצור דרך.
השיטה משפרת את ההקשר הרחב של חיפוש אג'נטי בכך שהיא מבטיחה אמינות גבוהה יותר בשימושים פרקטיים, כמו אוטומציה עסקית או כלים מבוססי AI. בהשוואה לשיטות קודמות, BAPO מונעת את הסיכון של תשובות 'מזויפות' ומאפשרת לסוכנים לדעת מתי להפסיק. בישראל, שבה חברות טק מובילות משלבות AI בקצב מהיר, פתרון כזה יכול למנוע טעויות יקרות ביישומים מקומיים.
ניסויים נרחבים על ארבעה בנצ'מרקים מוכיחים כי BAPO משפרת באופן ניכר את האמינות הכוללת של חיפוש אג'נטי. עבור מנהלי עסקים, זה אומר סוכני AI אמינים יותר שמפחיתים סיכונים ומגבירים אמון. השיטה מצביעה על כיוון חשוב: אמינות חייבת להיות חלק בלתי נפרד מפיתוח סוכנים מתקדמים.