Ai2 משיקה Olmo 3.1: שיפורי RL דרמטיים בבינה מלאכותית
מוצר חדש

Ai2 משיקה Olmo 3.1: שיפורי RL דרמטיים בבינה מלאכותית

מכון Ai2 הרחיב אימון למידת חיזוק ב-21 ימים נוספים, ומשיג שיאים חדשים במבחני מתמטיקה, חשיבה והוראות

3 דקות קריאה
מבוסס על כתבה שלVentureBeatתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • הארכת אימון RL ב-21 ימים הביאה לשיפורים של 5-20 נקודות במבחנים מרכזיים.

  • Olmo 3.1 Think 32B עלה על Qwen 3 וקרוב ל-Gemma 27B.

  • Olmo 3.1 Instruct 32B מוכן לצ'אט, כלים ודיאלוגים רב-תוריים.

  • זמין ב-Hugging Face עם מחויבות לשקיפות מלאה.

  • מתאים לעסקים: אימון מחדש ושליטה בנתונים.

Ai2 משיקה Olmo 3.1: שיפורי RL דרמטיים בבינה מלאכותית

  • הארכת אימון RL ב-21 ימים הביאה לשיפורים של 5-20 נקודות במבחנים מרכזיים.
  • Olmo 3.1 Think 32B עלה על Qwen 3 וקרוב ל-Gemma 27B.
  • Olmo 3.1 Instruct 32B מוכן לצ'אט, כלים ודיאלוגים רב-תוריים.
  • זמין ב-Hugging Face עם מחויבות לשקיפות מלאה.
  • מתאים לעסקים: אימון מחדש ושליטה בנתונים.

בעולם שבו בינה מלאכותית הופכת לכלי עסקי קריטי, מכון Allen Institute for AI (Ai2) משיק את משפחת Olmo 3.1 – הדגמים החזקים ביותר שלו עד כה. הדגמים החדשים מתמקדים ביעילות, שקיפות ובקרה, ומציעים שיפורים משמעותיים במבחנים מאתגרים. Ai2 המשיכה את אימוני הלמידה בחיזוק (RL) של Olmo 3 Think 32B במשך 21 ימים נוספים על 224 כרטיסי מסך, מה שהוביל לפריצות דרך במתמטיקה, חשיבה והבנת הוראות. זהו צעד שמאפשר לעסקים ישראליים להתקדם בטכנולוגיות AI פתוחות.

Ai2 עדכנה שניים משלושת הדגמים: Olmo 3.1 Think 32B, המותאם למחקר מתקדם, ו-Olmo 3.1 Instruct 32B, המיועד לעקוב אחר הוראות, דיאלוגים רב-תוריים ושימוש בכלים. הדגם השלישי, Olmo 3-Base, מתאים לתכנות, הבנה ומתמטיקה, ומשמש גם להמשך אימון. לפי Ai2, ההארכה באימון RL על נתוני Dolci-Think-RL הביאה לשיפורים של 5+ נקודות במבחן AIME, 4+ ב-ZebraLogic וב-IFEval, ו-20+ ב-IFBench, לצד ביצועים טובים יותר בקידוד ובמשימות מורכבות.

עבור Olmo 3.1 Instruct 32B, Ai2 יישמה את המתכון שהצליח בדגם הקטן יותר 7B. הדגם החדש מותאם לצ'אט, שימוש בכלים ודיאלוגים רב-תוריים, והוא "האח הגדול המהימן יותר של Olmo 3 Instruct 7B, מוכן ליישומים בעולם האמיתי", כך מציינת Ai2. בנוסף, Ai2 שדרגה את דגמי RL-Zero 7B למתמטיקה וקידוד באמצעות אימונים ארוכים ויציבים יותר.

Olmo 3.1 Think 32B עלה על Qwen 3 32B במבחן AIME 2025 והתקרב לביצועי Gemma 27B. Olmo 3.1 Instruct 32B התבלט מול עמיתיו בקוד פתוח, כולל ניצחון על Gemma 3 במבחן מתמטיקה. Ai2 מכנה אותו "הדגם הפתוח החזק ביותר בקנה מידה 32B להוראות". הדגמים זמינים כעת ב-Ai2 Playground וב-Hugging Face, עם גישה דרך API בקרוב.

השקת Olmo 3.1 מדגישה את מחויבותה של Ai2 לשקיפות ולקוד פתוח. הדגמים מאפשרים לארגונים להוסיף נתונים משלהם ולאמן מחדש, תוך שימוש בכלי OlmoTrace שמעקב אחר התאמת הפלטים לנתוני האימון. זהו יתרון גדול לעסקים המחפשים שליטה מלאה במודלי AI, במיוחד בישראל שבה רגולציה על AI מתגברת.

עבור מנהלי עסקים ישראליים, Olmo 3.1 פותח אפשרויות חדשות ליישומי AI פתוחים ויעילים. השיפורים בהיגיון ובמתמטיקה יכולים לשפר אוטומציה בתהליכים עסקיים, בעוד השקיפות מבטיחה עמידה בתקנים. כיצד תשלבו דגמים כאלה במערכות שלכם?

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של VentureBeat. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

עוד מ־VentureBeat

כל הכתבות מ־VentureBeat
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי
חדשות
4 דקות
מ־VentureBeat

Listen Labs גייסה 69 מיליון דולר אחרי קמפיין שילוט ויראלי

אלפרד וולפורס מ-Listen Labs השתמש בלוח מודעות ויראלי כדי לגייס כישרונות, וכעת החברה גייסה 69 מיליון דולר. הפלטפורמה מבצעת ראיונות לקוחות AI מהירים ומדויקים, פותרת בעיות הונאה ומשמשת מיקרוסופט ועוד. קראו עכשיו על השינוי במחקר שוק!

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI
מוצר חדש
3 דקות
מ־TechCrunch

AMD קוראת תיגר על Nvidia עם מערכת המסד Helios למחשוב AI

לפי דיווח של TechCrunch, חברת השבבים AMD משיקה את מערכת ה-Helios, מערכת שרתים שלמה במסד (rack-scale system) המיועדת להתחרות ישירות במובילת השוק Nvidia. המערכת החדשה, שתוכננה עבור מעבדות ה-AI הגדולות בעולם כדי לאמן ולהריץ את מודלי הקצה התובעניים ביותר, כבר גייסה רשימה של לקוחות ענק הכוללת את מיקרוסופט, OpenAI, Meta, Oracle ו-Anthropic. מיקרוסופט מתכננת להרחיב את תשתית הענן Azure באמצעותה, ואילו Anthropic הכריזה על שיתוף פעולה לפריסת עד שני גיגוואט של מעבדים גרפיים. בנוסף, AMD הציגה את מעבד ה-Venice-X המיועד למרכזי נתונים שיושק ב-2027. מנכ"לית AMD, ד"ר ליסה סו, מעריכה כי העלייה בביקוש למחשוב המונעת על ידי בינה מלאכותית סוכנתית (agentic AI) תוביל את שוק מאיצי ה-AI לשווי של כ-1.4 טריליון דולר עד שנת 2030.

קרא עוד
Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית
מוצר חדש
4 דקות
מ־TechCrunch

Runway משיקה מנתב מודלים של בינה מלאכותית למדיה גנרטיבית

חברת הסטארט-אפ Runway משיקה את Runway Media Router, כלי חדש המאפשר למפתחים לנתב באופן אוטומטי בקשות יצירת תמונה, וידאו ואודיו למודל המתאים ביותר. הכלי, שהושק באמצעות פלטפורמת המפתחים Runway Dev, מנתב את הבקשות על פי העדפות המפתח לגבי איכות, מהירות או עלות. המהלך מסמן את שאיפתה של Runway להפוך לשכבת תשתית ואורקסטרציה עבור תעשיית המדיה הגנרטיבית, בתקופה שבה השוק נעשה צפוף ותחרותי במיוחד והחברה מתמודדת עם תחרות עזה מצד ענקיות טכנולוגיה כמו גוגל, בייטדאנס ועליבאבא.

קרא עוד
גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite
מוצר חדש
5 דקות
מ־DeepMind

גוגל מציגה את דגמי Gemini 3.6 Flash ו-3.5 Flash-Lite

חברת גוגל הכריזה על השקת דגמי בינה מלאכותית חדשים בסדרת פלאש: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ו-Gemini 3.5 Flash Cyber. הדגמים מיועדים לפיתוח סוכני AI בייצור ומציעים שיפור ביעילות הטוקנים, מהירות וחיסכון בעלויות. דגם 3.6 Flash מפחית ב-17% את צריכת טוקני הפלט בהשוואה לגרסה הקודמת, ודגם 3.5 Flash-Lite פועל במהירות של 350 טוקני פלט לשנייה. כמו כן, דגם הסייבר הייעודי 3.5 Flash Cyber ישולב במערכת CodeMender ויופץ בשלב זה במתכונת פיילוט מוגבלת לממשלות ולשותפים מהימנים בלבד לצורך זיהוי ותיקון חולשות אבטחה.

קרא עוד
OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי
מוצר חדש
4 דקות
מ־TechCrunch

OpenAI משיקה מקלדת לניהול סוכני קוד ברקע מאבק משפטי

לפי דיווח ב-TechCrunch, חברת OpenAI נכנסת לשוק החומרה עם השקת מקלדת ה-Codex Micro במחיר של 230 דולר, המיועדת לניהול סוכני תכנות חצי-אוטונומיים. המקלדת פותחה בשיתוף עם Work Louder וכוללת מקשים מוארים להצגת סטטוס, ג'ויסטיק וחוגה לכיוונון רמת החשיבה של הסוכן. במקביל, דיווח של Bloomberg חשף כי החברה מפתחת רמקול חכם נייד ונטול מסך בעל חלקים נעים, המעוצב על ידי מהנדסי Apple לשעבר. פיתוח זה עומד במרכז תביעה שהגישה Apple נגד OpenAI בשבוע שעבר בטענה לגניבת סודות מסחריים, טענות ש-OpenAI מכחישה לחלוטין.

קרא עוד