בפוסט של Microsoft Research נחשפה Orchard, תשתית קוד פתוח למחקר סוכני בינה מלאכותית (Agentic AI) בקנה מידה רחב ובעלות יעילה. הפרויקט נבנה סביב Orchard Env, שירות סביבה הניתן לשימוש חוזר שמטרתו לאמן ולהעריך סוכנים במגוון דומיינים של משימות. אותה תשתית בסיסית תומכת בסוכנים המיועדים להנדסת תוכנה, לניווט באינטרנט ולעוזרים אישיים, ומאפשרת לאמן אותם ישירות בתוך מעטפת פריסה אמיתית כמו Codex, OpenClaw ו-ZeroClaw. גישה זו מאפשרת לחוקרים לעשות שימוש חוזר בסביבות עבודה, בצינורות נתונים (data pipelines) ובתהליכי הערכה על פני משימות שונות.
מבוא: פתרון צוואר הבקבוק במחקר סוכני בינה מלאכותית
טכנולוגיית הבינה המלאכותית מתקדמת במהירות מעבר למענה על שאלות סטטיות לעבר סוכנים אוטונומיים המסוגלים לתכנן, לנמק ולפעול בתוך סביבות מורכבות ורב-שלביות. סוכנים אלו מסוגלים לתקן באגים בקוד מקור מורכב, לנוווט ברשת בשם המשתמש ולנהל תהליכי עבודה הכוללים לוחות שנה ודואר אלקטרוני. למרות ההתלהבות סביב היכולות הללו, קהילת המחקר נתקלת בחסם מתמשך. פיתוח מערכות סוכנים מתקדמות דורש לעיתים קרובות תשתיות קנייניות, ובכלל זה סביבות ארגז חול (sandboxes) מותאמות אישית, צינורות אימון סגורים ומאגרי נתונים קנייניים, שמרבית החוקרים ואנשי המקצוע אינם יכולים לגשת אליהם או לשחזר אותם. כדי לפתור פער זה, החוקרים מציגים את Orchard – פלטפורמת קוד פתוח למידול סוכנים מדרגי. בליבת הפרויקט נמצא Orchard Env, סביבה קלת-משקל המבוססת על Kubernetes ומספקת רכיבים מבודדים לשימוש חוזר לצורך הפעלה ובנייה של סוכנים בקנה מידה רחב – החל מאיסוף נתוני אימון, דרך פריסות של למידת חיזוק (reinforcement learning rollouts) ועד להערכה.
הארכיטקטורה של Orchard Env: הפרדת שכבת הסביבה
הרעיון המרכזי מאחורי Orchard הוא שסביבת ההרצה צריכה להוות שירות עצמאי וניתן לשימוש חוזר, במקום להיות תשתית המוטמעת בתוך מסגרת אימון ספציפית. בסיס ה-Kubernetes של Orchard Env מאפשר לה ליצור, לנהל ולהסיר אלפי רכיבים מבודדים במקביל. המערכת מתוכננת לעבוד על פני משימות מגוונות כגון כתיבת קוד, גלישה באינטרנט ושימוש בכלים. כמו כן, היא מותאמת לעבודה עם מערכות סוכנים שונות ובשלבים שונים של תהליכי האימון וההערכה, כולל זיקוק נתונים (data distillation) ופריסות של למידת חיזוק. גמישות זו הופכת את Orchard למעשית בקנה מידה מחקרי, ומאפשרת לצוותים להציג מדדי הערכה (benchmarks) חדשים, מערכות סוכנים או אלגוריתמי אימון מבלי לבנות מחדש את התשתית הבסיסית מאפס.
אימון סוכנים ישירות בתוך מעטפת פריסה אמיתית
אחד המאפיינים הייחודיים של Orchard הוא היכולת לאמן סוכנים ישירות בתוך מעטפות פריסה אמיתיות (harnesses). כיום, הסוכנים בעלי היכולות הגבוהות ביותר ממעטים לפעול כמודל בודד ונקי; הם פועלים דרך מעטפות מתוחכמות, כגון Claude Code, Codex ו-OpenClaw, המנהלות נימוק רב-שלבי, שימוש בכלים וחיבורים למערכות חיצוניות. כלי אימון פתוחים בדרך כלל אינם מסוגלים להתמודד עם מעטפות אלו, שהן מרובות תהליכים ובעלות מצב (stateful), מה שמאלץ חוקרים לאמן את המודלים על גבי תחליפים מפושטים ואז לפרוס אותם בסביבה האמיתית – דבר היוצר חוסר התאמה. Orchard סוגרת את הפער הזה: פרוקסי (proxy) קל-משקל מתעד את קריאות המודל של המעטפת עצמה כנתוני אימון, בעוד שכל פריסה (rollout) רצה בתוך מכולה (container) משלה. כך ניתן לאמן סוכן מקצה לקצה ישירות בתוך מעטפת הפריסה שבה הוא עתיד לפעול – דוגמת OpenClaw, Codex, ZeroClaw ואחרות – ואף על פני מספר מעטפות במקביל.
Orchard-SWE: פריצת דרך בסוכני הנדסת תוכנה בקוד פתוח
הנדסת תוכנה היא אחד הדומיינים התובעניים ביותר עבור סוכנים אוטונומיים, שכן היא דורשת חשיבה רב-שלבית על גבי קוד מקור אמיתי, שימוש בכלים ויכולת להתאושש משגיאות. Orchard-SWE הוא תהליך העבודה של החוקרים לאימון בדומיין זה. הוא בנוי על בסיס תשתית Mini-SWE-Agent, המיועדת לפתרון משימות הנדסת תוכנה באופן אוטונומי, ומוערך על גבי מדד ההערכה הנפוץ SWE-bench Verified, הבוחן את יכולתו של מודל לנווט, לאבחן ולתקן קוד מקור בעולם האמיתי. כדי לאמן את המערכת, החוקרים זיקקו 107,000 אינטראקציות של סוכנים משני מודלים מתקדמים בעלי משקלים פתוחים (MiniMax-M2.5 ו-Qwen3.5-397B), המכסים מגוון רחב של בעיות (Issues) מ-GitHub. תהליך האימון עושה שימוש בכוונון עדין מונחה תחת הקצאת קרדיט (credit-assignment supervised fine-tuning): במקום להשליך לחלוטין ניסיונות שבהם הסוכן נכשל בפתרון מלא של הבעיה, המערכת לומדת מהחלקים הפרודוקטיביים של אותם ניסיונות חלקיים, ובכך מרחיבה את כמות נתוני האימון השימושיים הזמינים למודל. בשלב הבא מיושמת למידת חיזוק, אך המשוב בה הוא דליל (sparse) – סוכן בדרך כלל לומד רק אם התיקון הסופי שלו עבר או נכשל במבחנים הנסתרים. החוקרים מתחילים עם Balanced Adaptive Rollout, שנועד להפיק את המרב מאותם אותות הצלחה נדירים, ולאחר מכן מוסיפים שתי טכניקות "תגמול דחוס" (dense reward) להנחיה עשירה יותר: זיקוק מבוסס מדיניות (on-policy distillation), שבו מודל מורה חזק יותר מדרג את החלטות הסוכן צעד אחר צעד, וממודל תגמול תהליכי (process reward model), שבו שופט בינה מלאכותית מתגמל תהליך פתרון בעיות נכון – כגון כתיבת בדיקות המשחזרות את הבאג, אימות התיקון ובדיקה שההתנהגות הקיימת עדיין עובדת – ללא קשר לשאלה האם הבדיקות הסופיות עברו בהצלחה. לבסוף, מאומן מודל ערך (value model) על גבי פריסות קודמות כדי לדרג מחדש פתרונות מועמדים. למידת חיזוק מייצרת נתיבי תרגול רבים שבדרך כלל מושלכים; במקום זאת, נתיבים מ-20 ניסויים קודמים מאמנים מודל ערך קומפקטי בעל 4 מיליארד פרמטרים המזהה פתרונות באיכות גבוהה, ובזמן פתרון הבעיות הוא מדרג מספר תשובות מועמדות ובוחר את הטובה ביותר. טכניקות אלו ביחד מעלות את Orchard-SWE מנקודת בסיס (baseline) של 61.4% ב-SWE-bench Verified ל-69.1% עם Balanced Adaptive Rollout, ול-69.7% עם טכניקות התגמול הדחוס. זהו מצב דברים המהווה רף ביצועים מוביל חדש (state of the art) בקרב מודלי קוד פתוח בגודל דומה (כ-3 מיליארד פרמטרים פעילים, מודל 35B-A3B). הציון עולה ל-73% בשילוב דירוג מחדש באמצעות מודל הערך, ובכך מתקרב לביצועיהן של מערכות קצה (frontier systems) הגדולות ממנו פי 10 ויותר.
Orchard-GUI: סוכן דפדפן קל-משקל למשימות אינטרנט אמיתיות
ניווט ברשת מציב קבוצה שונה של אתגרים. סוכנים נדרשים לפענח פריסות חזותיות, לקיים אינטראקציה עם ממשקים דינמיים ולהשלים משימות פתוחות המתוארות בשפה טבעית בלבד. Orchard-GUI מאמן מודל שפה-חזותי (vision-language model) בעל 4 מיליארד פרמטרים כסוכן דפדפן באמצעות כמות קטנה יחסית של פיקוח: 400 הדגמות מזוקקות בשילוב עם 2,200 משימות אימון פתוחות. למרות מידע האימון המוגבל הזה, המודל משיג תוצאות חזקות על פני מספר מדדי הערכה לניווט ברשת: 74.1% ב-WebVoyager, 67.0% ב-Online-Mind2Web ו-64.0% ב-DeepShop, המסתכמים בממוצע של 68.4%. תוצאות אלו ממקמות את Orchard-GUI בין סוכני הרשת החזקים ביותר בקוד פתוח כיום, תוך שמירה על תחרותיות מול מודלים קנייניים גדולים יותר של OpenAI וגוגל. הממצאים הללו מראים כי באמצעות גישת האימון והסביבה הנכונות, מודלים פתוחים קטנים יכולים להפגין ביצועים מעולים במשימות רשת בעולם האמיתי.
Orchard-Claw: סוכני עוזר אישי לפרודוקטיביות יומיומית
רבות מאפליקציות הסוכנים המשפיעות ביותר נוגעות למשימות פרודוקטיביות יומיומיות, הכוללות קריאה וכתיבה של הודעות דואר אלקטרוני, ניהול לוחות שנה, חיפוש מידע ותיאום בין כלים שונים. Orchard-Claw מתמקד במשימות עוזר אישי על ידי אימון סוכן על גבי 200 משימות סינתטיות בלבד. במסגרת הערכה על גבי Claw-Eval, מדד הערכה המכסה תהליכי עבודה מציאותיים של פרודוקטיביות, הסוכן השלים בהצלחה 59.6% מהמשימות כאשר ניתנו לו עד שלושה ניסיונות. שיעור ההצלחה עלה ל-73.9% כאשר הוא שולב עם מערכת הסוכנים החזקה יותר ZeroClaw. מכיוון ש-Orchard מסוגלת לאמן סוכנים ישירות בתוך מעטפות פריסה אמיתיות, Orchard-Claw אומן על פני מספר מעטפות כאלו – כולל ReACT, ZeroClaw, OpenClaw ו-Codex – במקום בלולאה מפושטת אחת. אימון בתוך מעטפות אמיתיות אלו שיפר משמעותית את אמינות הסוכן; תחת מעטפת Codex, למשל, שיעור ההצלחה שלו עלה מ-18.6% עבור המודל הלא מאומן ל-51.5% לאחר אימון באמצעות Orchard.
השלכות לעתיד וצבירת ניסיון במחקר סוכנים
התוצאות של פרויקט Orchard מחזקות תובנה רחבה יותר: לשכבת הסביבה יש חשיבות מכרעת. על ידי הפיכת התשתית הבסיסית לפתוחה, קלת-משקל וניתנת לשימוש חוזר, Orchard מפחיתה את עלויות המחקר של סוכני בינה מלאכותית. צוותים אינם נדרשים עוד לבנות סביבות מבודדות מותאמות אישית מאפס או להסתמך על שירותי ענן קנייניים. ניתן להשתמש באותו Orchard Env לייצור נתוני אימון, להרצת פריסות של למידת חיזוק ולהערכת מודלים סופיים ללא צורך בבנייה מחדש של המערכת בכל פעם מחדש. במבט קדימה, החוקרים מזהים את השימוש החוזר בניסיון האימון כנתיב מבטיח לעבר למידה מצטברת של סוכנים (cumulative agent learning). במקום להשליך נתיבי פעולה (trajectories) עם סיום ריצת האימון, המערכת מתייחסת אליהם כנכסים קבועים – למשל, על ידי זיקוקם למודלי ערך הניתנים לשימוש חוזר. הדבר מאפשר לניסיון של הסוכנים להצטבר לאורך זמן, ומאפשר לכל דור חדש של סוכנים לרשת ולהרחיב את הידע שרכשו קודמיהם, במקום להתחיל מאפס. יעילות הנתונים שהופגנה ב-Orchard-GUI מצביעה על כך שניתן לאמן סוכני רשת בקנה מידה גדול יותר מבלי להידרש לכמויות גדולות של נתוני אימון שנוצרו ידנית.