מודלי AI לומדים בעצמם: שואלים שאלות ומשפרים יכולות
מחקר

מודלי AI לומדים בעצמם: שואלים שאלות ומשפרים יכולות

פרויקט Absolute Zero Reasoner מאפשר למודלים לייצר בעיות קוד, לפתור אותן ולשפר את עצמם ללא התערבות אנושית – צעד לכיוון סופר-אינטליגנציה

4 דקות קריאה
מבוסס על כתבה שלWiredתרגום, סיכום והקשר עסקי על-ידי המערכתאיך אנחנו עובדים

תקציר מנהלים

נקודות עיקריות

  • AZR מייצר בעיות קוד Python, פותר אותן ובודק אוטומטית כדי לשפר מודלי Qwen.

  • הגישה עלתה על מודלים עם נתונים אנושיים ומדמה למידה אנושית.

  • פוטנציאל להרחבה למשימות מורכבות וסופר-אינטליגנציה, עם פרויקטים דומים במעבדות גדולות.

מודלי AI לומדים בעצמם: שואלים שאלות ומשפרים יכולות

  • AZR מייצר בעיות קוד Python, פותר אותן ובודק אוטומטית כדי לשפר מודלי Qwen.
  • הגישה עלתה על מודלים עם נתונים אנושיים ומדמה למידה אנושית.
  • פוטנציאל להרחבה למשימות מורכבות וסופר-אינטליגנציה, עם פרויקטים דומים במעבדות גדולות.

בעידן שבו מודלי הבינה המלאכותית החכמים ביותר עדיין מחקים בני אדם, חוקרים מציגים גישה חדשנית: AI ששואל שאלות לעצמו ומתאמן באופן עצמאי. פרויקט Absolute Zero Reasoner (AZR), שפותח על ידי אוניברסיטת צינגחואה, מכון BIGAI בבייג'ינג ואוניברסיטת פנסילבניה סטייט, מדגים כיצד מודל שפה גדול (LLM) מייצר בעיות קוד Python מאתגרות אך פתירות, פותר אותן, בודק את התוצאות על ידי הרצת הקוד ומשפר את עצמו על סמך ההצלחות והכשלונות. גישה זו עשויה לשנות את חוקי הלמידה של AI ולהוביל ליכולות על-אנושיות. (72 מילים)

המערכת AZR פועלת בשלושה שלבים עיקריים: ראשית, ה-LLM מייצר בעיות קוד מורכבות אך ניתנות לפתרון. לאחר מכן, אותו מודל מנסה לפתור את הבעיות. לבסוף, הוא בודק את הפתרון על ידי הרצת הקוד ומשתמש בתוצאות כדי לחדד את יכולותיו – הן ביצירת בעיות טובות יותר והן בפתרונן. החוקרים בדקו את השיטה על גרסאות של 7 מיליארד ו-14 מיליארד פרמטרים של מודל Qwen הפתוח, והשיגו שיפור משמעותי ביכולות קידוד והיגיון. לפי הדיווח, המודלים אף עלו על מתחרים שקיבלו נתונים מעוצבים על ידי בני אדם. (98 מילים)

אנדרו זאו, סטודנט לדוקטורט בצינגחואה שיזם את הרעיון, וזילונג ז'נג מחוקר BIGAI, מסבירים כי הגישה דומה ללמידה אנושית אמיתית. "בהתחלה מחקים הורים ומורים, אבל כדי להתקדם צריך לשאול שאלות עצמאיות", אומר זאו. השיטה, המכונה לעיתים 'self-play', מוכרת כבר שנים ומבוססת על עבודות של חלוצי AI כמו יורגן שמידהובר ופייר-יווס אוודייה. מה שמרשים הוא שהקושי גדל עם כוח המודל, מה שמאפשר התקדמות מתמשכת. (92 מילים)

האתגר העיקרי כרגע הוא שהשיטה עובדת רק על בעיות שניתן לבדוק אוטומטית, כמו מתמטיקה או קוד. בעתיד, ניתן יהיה להרחיב ל nhiệmות סוכנים כמו גלישה באינטרנט או משימות משרדיות, כאשר ה-AI ישפוט את נכונות הפעולות. ז'נג מציין כי גישה כזו יכולה לאפשר למודלים לעבור מעבר להוראה אנושית: "זהו דרך להגיע לסופר-אינטליגנציה". פרויקטים דומים כבר צצים במעבדות גדולות, כמו Agent0 של סיילספורס, סטנפורד ואוניברסיטת צפון קרוליינה, שמשפר סוכנים באמצעות self-play. (96 מילים)

מאמר אחר ממטא, אוניברסיטת אילינוי וקרנגי מלון מציג self-play להנדסת תוכנה, וטוען כי זה צעד ראשון לסוכני תוכנה סופר-אינטליגנטיים. בעוד מקורות נתונים קונבנציונליים מתייקרים ומתמעטים, שיטות כאלה הופכות קריטיות. בישראל, שבה חברות טק מובילות בתחום AI, התפתחויות כאלה משמעותיות במיוחד – הן מאפשרות פיתוח מודלים עצמאיים שיתחרו בענקיות גלובליות. (85 מילים)

השלכות עסקיות ברורות: מנהלי עסקים יכולים לצפות ל-AI שמתאמן בעצמו על נתונים פנימיים, חוסך זמן ומשאבים. השנה צפויות התקדמויות נוספות בשיטות למידה עצמאיות, שיהפכו מודלים מפחות 'מחקי' ליותר יצירתיים כמו בני אדם. (68 מילים)

מה תהיה ההשפעה על תעשיית הטכנולוגיה הישראלית? האם נראה חברות מקומיות מאמצות self-play כדי להאיץ חדשנות? קראו את המאמר המלא כדי להבין כיצד להיערך. (52 מילים)

שאלות ותשובות

שאלות נפוצות

הכתבה הוכנה על-ידי המערכת בליווי בינה מלאכותית: תרגום, סיכום והוספת הקשר עסקי ישראלי מתוך פרסום מקורי של Wired. קראו על תהליך העריכה שלנו. קישור למקור המקורי.

אהבתם את הכתבה?

הירשמו לניוזלטר שלנו וקבלו עדכונים חמים מעולם ה-AI ישירות למייל

קלות מבהילה: כלי אוטומטי פרץ מנגנוני אבטחה של מודלי על
חדשות
4 דקות
מ־Wired

קלות מבהילה: כלי אוטומטי פרץ מנגנוני אבטחה של מודלי על

כתבה המבוססת על דיווח במגזין WIRED חושפת מבדק בטיחות מקיף שערך ארגון FAR.AI על מודלי בינה מלאכותית מובילים של ארבע חברות אמריקאיות גדולות. הבדיקה, שהשתמשה בכלי אוטומטי המייצר למעלה מאלף גרסאות של פניות בעייתיות, גילתה כי מודל Grok של SpaceXAI ומודל Gemini של גוגל פגיעים במיוחד לפריצה (Jailbreak), בעוד מודלי אנתרופיק ו-OpenAI הציגו חסינות מלאה למתקפה הספציפית. הדוח מדגיש את העלויות הנמוכות להפליא של הפעלת מתקפות אלו ואת הצורך הגובר ברגולציה חיצונית כפויה על התעשייה.

קרא עוד
טעויות כתיב מכוונות ופחות קווים מפרידים: תרבות הנגד הספרותית החדשה
ניתוח
5 דקות
מ־Wired

טעויות כתיב מכוונות ופחות קווים מפרידים: תרבות הנגד הספרותית החדשה

גל גובר של סופרים, עיתונאים ויוצרים ברשתות החברתיות מובילים לאחרונה תרבות-נגד סגנונית חדשה המכוונת כולה נגד המאפיינים המזוהים עם כתיבת בינה מלאכותית. בהשראת החשש הגובר מהדמיון לתוצרי צ'אטבוטים, יוצרים רבים נמנעים במכוון מרשימות משולשות, מקווים מפרידים ומשימוש בקול סביל, ובמקום זאת פונים לכתיבה הרפתקנית בגוף ראשון. התופעה באה לידי ביטוי במגזינים מובילים כמו פלייבוי ופיצ'פורק שעדכנו את הנחיות העריכה שלהם, ועד לפיתוח אפליקציות שמשאירות שגיאות כתיב בכוונה כדי לעודד מעורבות.

קרא עוד
שיחות פרטיות של Claude נחשפו בתוצאות החיפוש של גוגל ובינג
חדשות
5 דקות
מ־Wired

שיחות פרטיות של Claude נחשפו בתוצאות החיפוש של גוגל ובינג

לפי דיווח של מגזין WIRED, שיחות פרטיות שנערכו עם הצ'אטבוט Claude של חברת Anthropic נחשפו לאחרונה בתוצאות החיפוש של מנועי החיפוש הגדולים גוגל (Google) ובינג (Bing). התקרית חושפת את המורכבות שבמניעת סריקה ואינדוקס של שיחות משותפות על ידי מנועי חיפוש. למרות ש-Anthropic משתמשת בקובץ robots.txt כדי להנחות סורקי רשת לא לאנדקס שיחות משותפות, דפי השיחות הללו לא כללו תגיות noindex ייעודיות, אותן דורשים מנועי החיפוש כדי להימנע מאינדוקס דפים שמקושרים ממקומות אחרים ברשת. השיחות שנחשפו כללו התייעצויות פוליטיות, שאלות אתיות של עורכי דין ומשחקי תפקידים. המשתמשים יכולים לנהל ולמחוק שיחות אלו דרך הגדרות הפרטיות ב-Claude.

קרא עוד
כוורת הבינה המלאכותית של דונלד טראמפ: מי קובע את המדיניות מול סין
חדשות
5 דקות
מ־Wired

כוורת הבינה המלאכותית של דונלד טראמפ: מי קובע את המדיניות מול סין

לפי דיווח במגזין WIRED, ממשל טראמפ נסמך על קבוצת פקידים קטנה ומבוזרת לעיצוב מדיניות הבינה המלאכותית מול סין. הקבוצה, הכוללת את שר המסחר הווארד לוטניק, מנהל הסייבר שון קיירנקרוס, שר האוצר סקוט בסנט וראש הסגל סוזי ויילס, חלוקה בגישותיה. בעוד חלקם תומכים ברגולציה קשוחה ובסנקציות על מעבדות סיניות בשל שימוש בפרקטיקת "זיקוק" מודלים אמריקאיים, אחרים, כמו המשקיע וצאר ה-AI לשעבר דייוויד סאקס, דוחפים לגישה חופשית (laissez-faire) ומזעור רגולציה כדי לשמור על יתרון טכנולוגי.

קרא עוד

עוד כתבות שיעניינו אותך

לכל הכתבות
SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים
מחקר
5 דקות
מ־Google Research

SymptomAI: סוכן בינה מלאכותית שיחתי להערכת סימפטומים רפואיים

מחקר לאומי ראשון מסוגו שנערך על ידי Google Research בוחן את ביצועיו של SymptomAI – מערך סוכני בינה מלאכותית שיחתיים מבוססי Gemini Flash 2.0 המיועדים לראיונות סימפטומים והערכת אבחנה מבדלת (DDx). המחקר, שהקיף 13,917 משתתפים, השווה את האבחנות המבדלות שהפיק הסוכן אל מול הערכות של פאנל רופאים מומחים ודיווחים מביקורים רפואיים בעולם האמיתי. הממצאים מראים כי קלינאים העדיפו את אבחנות הסוכן בלמעלה מ-50% מהמקרים, וכי דיוק המערכת השתפר משמעותית באמצעות אסטרטגיות הנחיה אקטיביות. בנוסף, המחקר הדגים מתאם מובהק בין אבחנות המערכת לבין שינויים באותות פיזיולוגיים שנמדדו במכשירי פיטביט לבישים.

קרא עוד
פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות
מחקר
4 דקות
מ־VentureBeat

פער ההערכה של סוכני AI: פריסה לייצור למרות כשלים מול לקוחות

מחקר חדש של VentureBeat Pulse Research חושף כי קיים פער עמוק בין האוטונומיה המוענקת לסוכני AI לבין האמון במערכות הבדיקה שלהם. מחצית מהארגונים שנשאלו כבר השיקו סוכן שעבר את ההערכות הפנימיות אך כשל בפני לקוח בסביבת הייצור, ורק 5% סומכים באופן מלא על הערכות אוטומטיות כיום. למרות זאת, 66% מהארגונים מאפשרים או פועלים לאפשר פריסה אוטומטית לחלוטין ללא מעורבות אנושית. השוק מבוזר מאוד ורבים מתכננים להחליף פלטפורמות בשנה הקרובה.

קרא עוד
אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות
מחקר
5 דקות
מ־VentureBeat

אורקסטרציה של סוכני בינה מלאכותית בארגונים: פער בין שאיפות למציאות

סקר חדש של VentureBeat Pulse Research מיוני 2026 חושף פער עמוק בארגונים בין השאיפות לניהול סוכני בינה מלאכותית (AI) לבין המציאות בשטח. לפי הסקר, שנערך בקרב 101 ארגונים, קיים תהליך התגבשות סביב פלטפורמות של ספקי מודלים, ובראשן Claude של Anthropic (המובילה עם 40% מההטמעות), בעוד הבחירה מונעת מ'כוח המשיכה' של מודל הבסיס. עם זאת, בעוד ארגונים מגדירים הצלחה לפי ביצוע אמין של תהליכים מרובי-שלבים, 71% מהם מדווחים בכנות כי רבע או פחות מהסוכנים המוטמעים שלהם בפועל הם אכן מרובי-שלבים, ומרביתם הם רק מעטפות צ'אטבוט פשוטות. בנוסף, 27% מהארגונים חסרים בקרה פיננסית בזמן אמת על עלויות צריכת האסימונים של הסוכנים.

קרא עוד
כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research
מחקר
4 דקות
מ־Google Research

כיצד נוצרת היצירתיות של מודלי דיפוזיה? מחקר של Google Research

בפוסט חדש מטעם Google Research, מדען המחקר ג'נגדאו צ'ן מציג ממצאים מתוך מאמר שהתקבל לוועידת ICLR 2026, המפענח את מקור ה'יצירתיות' של מודלי דיפוזיה. לפי המחקר, היכולת של המודלים הללו לייצר נתונים חדשים, במקום לשנן באופן עיוור את מאגר האימון שלהם, היא תוצאה מתמטית של תהליך החלקת פונקציית הציון (score smoothing). החלקה זו נגרמת באופן טבעי בשל השפעות רגולריזציה במהלך אימון הרשתות העצביות, המונעות מהן ללמוד פונקציות בעלות מעברים חדים במיוחד. כתוצאה מכך, המודל מייצר אינטרפולציה במרווחים שבין נקודות המידע המקוריות של האימון. בסביבה רב-ממדית, אפקט זה פועל בכיוונים המשיקים ליריעת הנתונים הנסתרת, וכך מאפשר להשיג איזון מדויק בין איכות הנתונים לבין היצירתיות שלהם.

קרא עוד