בעידן שבו מודלי שפה גדולים (LLM) מייצרים תוכן רלוונטי ומעניין, הם נכשלים לעיתים קרובות בעמידה במגבלות פורמליות. התוצאה: תשובות נכונות מבחינה קונספטואלית אך פגומות מבחינה פרוצדורלית. חוקרים מציגים זרימת עבודה רב-סוכנית חדשנית שמפרידה בין תיאור המשימה הראשית לבין המגבלות הגרנולריות שלה, ומשתמשת בציונים כמותיים כמשוב לשיפור איטרטיבי של הפרומפטים. השיטה מבטיחה תוצאות טובות יותר ממקובל.
הבעיה המרכזית במודלי שפה גדולים היא הפער בין תוכן איכותי לעמידה בכללים מדויקים. גישות מסורתיות מתמקדות רק בשיפור ניסוח המשימה הראשית, ומזניחות את קריטריוני הקבלה הספציפיים. לפי המחקר, שיטה זו אינה מספיקה. במקום זאת, הצוות מציע זרימת עבודה רב-סוכנית שמבצעת אופטימיזציה נפרדת לכל חלק: תיאור המשימה והמגבלות. השימוש בציונים כמותיים מאפשר שכתובים חוזרים ומשופרים של הפרומפטים.
בבדיקות שנערכו על מודלים כמו Llama 3.1 8B ו-Mixtral-8x 7B, השיטה החדשה הניבה ציוני עמידה גבוהים משמעותית בהשוואה לפרומפטים מקוריים או משופרים מסורתיים. החוקרים מדווחים על שיפור ניכר בעמידה במגבלות פורמליות, מבלי לפגוע ברלוונטיות התוכן. זהו צעד קדימה חשוב בפיתוח כלים אוטומטיים לשיפור הוראות ל-LLM.
בהקשר רחב יותר, השיטה הזו רלוונטית במיוחד לעסקים ישראליים שמשתמשים ב-AI ליישומים עסקיים. מנהלי טכנולוגיה יכולים ליישם זרימות כאלה כדי להבטיח תוצאות מדויקות יותר במשימות כמו ניתוח נתונים או יצירת דוחות. בהשוואה לשיטות אחרות, הגישה הרב-סוכנית מציעה גמישות ודיוק גבוהים יותר, ומתאימה לעידן שבו LLM הופכים לכלי מרכזי בעסקים.
השלכות עתידיות כוללות שילוב השיטה בכלים אוטומטיים לפיתוח אפליקציות AI. עבור מנהלים, זה אומר פחות זמן על ניסוי וטעייה עם פרומפטים, ויותר התמקדות בתוצאות עסקיות. השיפור בעמידה בהוראות יאפשר שימוש בטוח יותר במודלים פתוחים כמו Llama.