סוכני AI נכשלים ב-63% במשימות מורכבות: Patronus AI מציגה סימולטורים גנרטיביים
מוצר חדש

סוכני AI נכשלים ב-63% במשימות מורכבות: Patronus AI מציגה סימולטורים גנרטיביים

הסטארט-אפ שגייס 20 מיליון דולר חושף ארכיטקטורה חדשה לאימון סוכנים בזמן אמת, שמבטיחה שיפור של 10-20% בביצועים

4 דקות קריאה
מבוסס על כתבה שלVentureBeatתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • סימולטורים גנרטיביים יוצרים סביבות אדפטיביות לאימון סוכני AI בזמן אמת.

  • שיפור של 10-20% בשלמת משימות כמו הנדסת תוכנה ושירות לקוחות.

  • מונעים 'האקינג תגמולים' בסביבות דינמיות.

  • צמיחה של פי 15 בהכנסות Patronus AI.

  • מתאימים לתחומים מגוונים כמו פיננסים ובריאות.

סוכני AI נכשלים ב-63% במשימות מורכבות: Patronus AI מציגה סימולטורים גנרטיביים

  • סימולטורים גנרטיביים יוצרים סביבות אדפטיביות לאימון סוכני AI בזמן אמת.
  • שיפור של 10-20% בשלמת משימות כמו הנדסת תוכנה ושירות לקוחות.
  • מונעים 'האקינג תגמולים' בסביבות דינמיות.
  • צמיחה של פי 15 בהכנסות Patronus AI.
  • מתאימים לתחומים מגוונים כמו פיננסים ובריאות.

בעידן שבו סוכני AI אמורים להחליף עובדים בביצוע משימות מורכבות, מציאות אחת מדאיגה: סוכן עם שיעור שגיאה של 1% בכל צעד ייכשל ב-63% מהמקרים אחרי 100 צעדים. Patronus AI, הסטארט-אפ שגייס 20 מיליון דולר ממשקיעים כמו Lightspeed Venture Partners ו-Datadog, מציגה היום את 'סימולטורים גנרטיביים' – ארכיטקטורה חדשה שמשנה את כללי המשחק באימון סוכני AI.

הטכנולוגיה יוצרת סביבות סימולציה אדפטיביות שמייצרות אתגרים חדשים בזמן אמת, מעדכנות חוקים באופן דינמי ומעריכות את ביצועי הסוכן תוך כדי למידה. זהו שינוי מהותי לעומת בנצ'מרקים סטטיים, שכשלו בחיזוי ביצועים בעולם האמיתי. 'בנצ'מרקים מסורתיים בודקים יכולות מבודדות, אבל מפספסים את ההפרעות, מעברי ההקשר והקבלות ההחלטות המורכבות של עבודה אמיתית', אמר אנד קנאפן, מנכ"ל וממייסד שותף של Patronus AI, בראיון בלעדי ל-VentureBeat.

לפי החברה, סימולטורים גנרטיביים בונים על למידה מחוזקת (RL), שבה סוכנים לומדים מניסוי וטעייה עם תגמולים ועונשים. אך בניגוד לגישות מסורתיות הדורשות שכת נרחבת של קוד, הטכנולוגיה החדשה מציעה 'שיפור עצמי רקורסיבי פתוח' (ORSI) – סביבות שבהן סוכנים משתפרים באופן רציף ללא אימון מחדש מלא. 'ראינו מעבר מבנצ'מרקים סטטיים לסביבות אינטראקטיביות', אמרה רבקה צ'יאן, סמנכ"לית טכנולוגיה וממייסדת שותפה.

במרכז הטכנולוגיה ניצב 'מתקן תוכנית לימודים' שמנתח התנהגות הסוכן ומשנה את רמת הקושי והאופי של התרחישים. זהו השראה ממורים אנושיים שמתאימים חומר לרמת התלמיד. קנאפן תיאר זאת כ'אזור גולדילוקס' – נתונים לא קלים מדי ולא קשים מדי. תוצאות ראשוניות מראות שיפור של 10-20% בשיעורי השלמת משימות במשימות כמו הנדסת תוכנה, שירות לקוחות וניתוח פיננסי.

הסימולטורים גנרטיביים פותרים גם בעיית 'האקינג תגמולים', שבה סוכנים מנצלים חולשות בסביבה במקום לפתור בעיות אמיתיות. על ידי יצירת סביבה 'זזה', החברה מונעת רמאויות כאלה. 'זה כמו תלמידים שמרמים במבחן סטטי, אבל בסביבה מתפתחת אנחנו יכולים לבדוק התאמה אמיתית', אמרה צ'יאן.

Patronus AI מדווחת על צמיחה של פי 15 בהכנסות השנה, הודות לסביבות האיכותיות שלה שמתאימות לדגמי AI מתקדמים. הפלטפורמה משמשת חברות Fortune 500 וחברות AI מובילות. למרות תחרות מ-Microsoft, NVIDIA ו-Meta, החברה טוענת שסביבות מיוחדות לתחומים כמו פיננסים, בריאות ואנרגיה קשות לבנייה פנימית.

השקת 'סביבות RL' מסמנת הרחבה מערכת בדיקה לאימון. 'סביבות הן הנפט החדש', אומר קנאפן. החברה שואפת להפוך נתוני עבודה אנושיים לסביבות למידה. זהו נקודת מפנה: מי ששולט בסביבות יעצב את יכולות סוכני AI.

מה זה אומר למנהלי עסקים ישראלים? כדאי לבחון כלים כאלה לשיפור סוכני AI בארגון, לפני שהמתחרים עושים זאת. האם סימולטורים גנרטיביים הם המפתח להצלחה?

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של VentureBeat. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

עוד מ־VentureBeat

כל הכתבות מ־VentureBeat
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי
חדשות
4 דקות
מ־VentureBeat

Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי

אלפרד וולפורס מ-Listen Labs השתמש בלוח מודעות ויראלי כדי לגייס כישרונות, וכעת החברה גייסה 69 מיליון דולר. הפלטפורמה מבצעת ראיונות לקוחות AI מהירים ומדויקים, פותרת בעיות הונאה ומשמשת מיקרוסופט ועוד. קראו עכשיו על השינוי במחקר שוק!

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI
מוצר חדש
3 דקות
מ־TechCrunch

AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI

לפי דיווח של TechCrunch, חברת השבבים AMD משיקה את מערכת ה-Helios, מערכת שרתים שלמה במסד (rack-scale system) המיועדת להתחרות ישירות במובילת השוק Nvidia. המערכת החדשה, שתוכננה עבור מעבדות ה-AI הגדולות בעולם כדי לאמן ולהריץ את מודלי הקצה התובעניים ביותר, כבר גייסה רשימה של לקוחות ענק הכוללת את מיקרוסופט, OpenAI, Meta, Oracle ו-Anthropic. מיקרוסופט מתכננת להרחיב את תשתית הענן Azure באמצעותה, ואילו Anthropic הכריזה על שיתוף פעולה לפריסת עד שני גיגוואט של מעבדים גרפיים. בנוסף, AMD הציגה את מעבד ה-Venice-X המיועד למרכזי נתונים שיושק ב-2027. מנכ"לית AMD, ד"ר ליסה סו, מעריכה כי העלייה בביקוש למחשוב המונעת על ידי בינה מלאכותית סוכנתית (agentic AI) תוביל את שוק מאיצי ה-AI לשווי של כ-1.4 טריליון דולר עד שנת 2030.

קרא עוד
Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית
מוצר חדש
4 דקות
מ־TechCrunch

Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית

חברת הסטארט-אפ Runway משיקה את Runway Media Router, כלי חדש המאפשר למפתחים לנתב באופן אוטומטי בקשות יצירת תמונה, וידאו ואודיו למודל המתאים ביותר. הכלי, שהושק באמצעות פלטפורמת המפתחים Runway Dev, מנתב את הבקשות על פי העדפות המפתח לגבי איכות, מהירות או עלות. המהלך מסמן את שאיפתה של Runway להפוך לשכבת תשתית ואורקסטרציה עבור תעשיית המדיה הגנרטיבית, בתקופה שבה השוק נעשה צפוף ותחרותי במיוחד והחברה מתמודדת עם תחרות עזה מצד ענקיות טכנולוגיה כמו גוגל, בייטדאנס ועליבאבא.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי
מוצר חדש
4 דקות
מ־TechCrunch

OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי

לפי דיווח ב-TechCrunch, חברת OpenAI נכנסת לשוק החומרה עם השקת מקלדת ה-Codex Micro במחיר של 230 דולר, המיועדת לניהול סוכני תכנות חצי-אוטונומיים. המקלדת פותחה בשיתוף עם Work Louder וכוללת מקשים מוארים להצגת סטטוס, ג'ויסטיק וחוגה לכיוונון רמת החשיבה של הסוכן. במקביל, דיווח של Bloomberg חשף כי החברה מפתחת רמקול חכם נייד ונטול מסך בעל חלקים נעים, המעוצב על ידי מהנדסי Apple לשעבר. פיתוח זה עומד במרכז תביעה שהגישה Apple נגד OpenAI בשבוע שעבר בטענה לגניבת סודות מסחריים, טענות ש-OpenAI מכחישה לחלוטין.

קרא עוד