האם מודלי שפה גדולים (LLM) יכולים לצבור 'חוכמה' מניסיון כמו בני אדם? מחקר חדש מ-arXiv מציג את Empirical-MCTS, מסגרת דו-לולאתית שמשנה את חיפוש עץ מונטה קרלו (MCTS) מחיפוש חסר-מצב ללמידה רציפה ללא פרמטרים. השיטה מחקה את הצטברות הניסיון האמפירי האנושי, ומאפשרת למודלים לשפר את יכולות ההיגיון שלהם לאורך זמן. החוקרים מדווחים על שיפורים משמעותיים במשימות היגיון מורכבות.
Empirical-MCTS פועל בשני לולאות: מקומית וגלובלית. הלולאה המקומית מבוססת על Pairwise-Experience-Evolutionary Meta-Prompting (PE-EMP), מנגנון אופטימיזציה רפלקסיבי שמשתמש במשוב זוגי כדי לסנתז קריטריונים אדפטיביים ולהתפתח meta-prompts (הנחיות מערכת) בזמן אמת. מנגנון זה מאפשר חקירה מקומית יעילה יותר בכל בעיה, תוך התאמה דינמית של אסטרטגיות החיפוש.
הלולאה הגלובלית מנוהלת על ידי סוכן אופטימיזציית זיכרון, שמנהל מאגר גלובלי כמדיניות קודמת דינמית. הסוכן משתמש בפעולות אטומיות כדי להזקק תובנות איכותיות גבוהות מכל הבעיות, ומאפשר העברת ידע בין משימות שונות. השילוב הזה מאחד חיפוש מובנה עם הצטברות אמפירית, ומשפר את הביצועים הכללי של המודל.
השיטה נבחנה בבנצ'מרקים מורכבים כמו AIME25, ARC-AGI-2 ו-MathArena Apex. לפי הדיווח, Empirical-MCTS עולה על אסטרטגיות MCTS חסרות-מצב ועל סוכנים מבוססי-ניסיון עצמאיים. התוצאות מדגישות את הצורך בשילוב חיפוש מובנה עם למידה אמפירית כדי להתמודד עם משימות היגיון פתוחות ומורכבות.
למנהלי עסקים ישראלים בתחום הטכנולוגיה, Empirical-MCTS פותח אפשרויות חדשות ליישומי AI מתקדמים כמו פתרון בעיות מתמטיות, משחקים אסטרטגיים ואוטומציה מורכבת. השיטה מאפשרת למודלים להשתפר באופן רציף, מה שמפחית עלויות פיתוח ומשפר יעילות. כדאי לעקוב אחר הפיתוחים הבאים – האם זו הדרך ל-AI 'חכם' יותר?