בעידן שבו מודלי שפה גדולים (LLMs) מצטיינים ביצירת קוד מפקודות באנגלית, שפות נמוכות משאבים כמו בנגלית נשארות הרחק מאחור. חוקרים מבית BLP-2025 מציגים את BanglaCodeAct, מסגרת חדשנית מבוססת סוכנים שמאפשרת יצירת קוד פייתון מפקודות בבנגלית בדיוק גבוה. המערכת משלבת prompting רב-סוכנים ותיקון עצמי איטרטיבי, ומשתמשת במודל LLM רב-לשוני בקצה פתוח. זהו צעד משמעותי לקידום AI בשפות מקומיות.
BanglaCodeAct פועלת במעגל Thought-Code-Observation: הסוכן חושב על הפקודה, מייצר קוד, בודק אותו ומתקן טעויות באופן אוטומטי. בניגוד לגישות קודמות שדורשות fine-tuning ספציפי למשימה, כאן אין צורך באימון נוסף. החוקרים בדקו מספר מודלים קטנים בקצה פתוח על קבוצת הנתונים mHumanEval המותאמת לבנגלית, והגיעו לתוצאות מרשימות במיוחד עם Qwen3-8B.
התוצאות מדהימות: Qwen3-8B עם BanglaCodeAct השיגה דיוק pass@1 של 94.0% על קבוצת הפיתוח ו-71.6% על קבוצת הבדיקה העיוורת. זהו שיא חדש עבור יצירת קוד מבנגלית לפייתון, ומדגיש את הפוטנציאל של חשיבה מבוססת סוכנים במודלים קטנים יחסית. הסקריפטים זמינים בגיטהאב, מה שמאפשר למפתחים לבדוק ולשפר.
המשמעות של BanglaCodeAct רחבה: היא פותחת דלתות לפיתוח AI נגיש יותר בשפות כמו עברית, ערבית או הינדית, שבהן נתונים מוגבלים. עבור עסקים ישראליים, זה אומר כלים פנימיים מותאמים לשפה העברית ללא צורך באימונים יקרים. בהשוואה למודלים גדולים באנגלית, הגישה הזו חסכונית ומדויקת יותר עבור שפות ספציפיות.
מה זה אומר למנהלי טכנולוגיה? כדאי לבחון סוכנים כאלה ליישומים מקומיים, במיוחד בתחומי אוטומציה ופיתוח תוכנה. עם קוד פתוח זמין, אפשר להתחיל מיד. האם זו ההתחלה של עידן AI רב-לשוני אמיתי?