חיפוש בחדשות

30 תוצאות עבור "מתמטיקה".

מודל שטרם שוחרר של Anthropic השיג התקדמות בהשערת רימן
חדשות
4 דקות
מ־TechCrunch

מודל שטרם שוחרר של Anthropic השיג התקדמות בהשערת רימן

לפי דיווח ב-TechCrunch, מודל בינה מלאכותית שטרם שוחרר של חברת Anthropic רשם התקדמות משמעותית בפתרון השערת רימן, אחת הבעיות הלא פתורות הגדולות במתמטיקה מזה 150 שנה. ההתקדמות הושגה לאחר שחבר צוות ללא הכשרה מתמטית הנחה את המודל לנסות להוכיח את ההשערה. המודל פעל במשך יום וחצי, בחן 650 רעיונות שונים בעזרת תיאום של 60 תת-סוכנים, והוציא 31 מיליון בסך הכל. ההישג אומת על ידי מתמטיקאים פנימיים בחברה וגובש בעזרת כלי הקוד הפתוח Lean. המקרה מעורר מחדש דיון בקהילה המדעית לגבי השפעת הבינה המלאכותית על ערכי המחקר המתמטי וייחוס הקרדיט לחוקרים אנושיים.

קרא עוד
מה מראה (ומה לא מראה) הגילוי האחרון של אנתרופיק?
מחקר
4 דקות
מ־MIT Technology Review

מה מראה (ומה לא מראה) הגילוי האחרון של אנתרופיק?

חברת אנתרופיק (Anthropic), המוערכת בשווי של כמעט טריליון דולר, פירסמה לאחרונה מחקר חדש שבו היא טוענת כי גילתה "חלון" אל המחשבות הפנימיות של מודל השפה קלוד (Claude). החוקרים זיהו מרחב פנימי שהם מכנים "מרחב ה-J" (או J-space), שבו מופיעות מילים שאינן חלק מהפלט הסופי אך משפיעות על פתרון הבעיות של המודל. וויל דאגלס הבן (Will Douglas Heaven), עורך בכיר ובעל דוקטורט במדעי המחשב, מסביר בראיון מיוחד מה בדיוק גילתה אנתרופיק, מדוע המתמטיקה של מודלי שפה היא כה מורכבת וכיצד ניתן להשתמש בגילוי זה כדי לנטר התנהגויות לא רצויות כמו הטיה או רמאות.

קרא עוד
למידה מונחית בינה מלאכותית: המחקר החדש של Google DeepMind
מחקר
4 דקות
מ־DeepMind

למידה מונחית בינה מלאכותית: המחקר החדש של Google DeepMind

מחקר מבוקר רחב-היקף (RCT) שפורסם על ידי Google DeepMind בשיתוף עם משרד החינוך של סיירה לאון וארגון Fab AI מציג תוצאות פורצות דרך בשילוב בינה מלאכותית בלמידה. הניסוי, שנערך בקרב 1,763 תלמידים לאורך שמונה שבועות, בחן את מודל "הלמידה המונחית" (Guided Learning) המבוסס על Gemini. התוצאות הראו שיפור הישגים ממוצע של 0.258 סטיות תקן במתמטיקה – נתון המקביל לעד 2.5 שנות לימוד בכיתות שבהן המורים שילבו את הכלי באופן אינטנסיבי. במקום לשמש כמנוע תשובות פשוט, המודל הונחה לפעול בשיטה סוקרטית, ושלח שאלות מכוונות ב-76% מהאינטראקציות, בעוד שפתרונות ישירים סופקו ב-2% בלבד מהמקרים. המחקר מדגיש את הפוטנציאל העצום של סוכני AI מבוססי פדגוגיה בעיצוב מחדש של הדרכות והכשרות גם במגזר העסקי.

קרא עוד
Bolzano למחקר מתמטי אוטונומי: מה זה אומר לעסקים
ניתוח
5 דקות
מ־arXiv cs.AI

Bolzano למחקר מתמטי אוטונומי: מה זה אומר לעסקים

**Bolzano היא מערכת רב-סוכנית מבוססת LLM שמנהלת כמה סוכנים במקביל יחד עם סוכן מאמת ובסיס ידע מתמשך.** לפי התקציר ב-arXiv, המערכת סייעה ב-8 בעיות במתמטיקה ובמדעי המחשב התאורטיים, כש-6 תוצאות הוגדרו כברמת פרסום ו-5 הושגו כמעט באוטונומיה מלאה. עבור עסקים בישראל, המשמעות החשובה איננה מתמטיקה אלא הארכיטקטורה: עבודה מקבילית, אימות ותיעוד לאורך זמן. זה בדיוק המודל שמתאים לתהליכי שירות, מכירות וניהול לידים דרך WhatsApp Business API, Zoho CRM ו-N8N — בתנאי שמגדירים בקרה, הרשאות ומדדים ברורים.

קרא עוד
COMPOSITE-STEM: מבחן חדש שמראה עד כמה סוכני AI עוד רחוקים
מחקר
5 דקות
מ־arXiv cs.AI

COMPOSITE-STEM: מבחן חדש שמראה עד כמה סוכני AI עוד רחוקים

**COMPOSITE-STEM הוא בנצ'מרק חדש שמודד עד כמה סוכני AI מסוגלים לבצע משימות מדעיות מורכבות, ולא רק להחזיר תשובה קצרה שנראית נכונה.** לפי המאמר ב-arXiv, הבנצ'מרק כולל 70 משימות שנכתבו בידי חוקרי דוקטורט בפיזיקה, ביולוגיה, כימיה ומתמטיקה, והמודל המוביל השיג 21% בלבד. מבחינת עסקים בישראל, זו תזכורת חשובה: אסור למדוד מערכות AI רק לפי דמו או תחושת בטן. אם אתם מחברים AI ל-WhatsApp, ל-Zoho CRM או ל-N8N, אתם צריכים לבדוק תהליך שלם — דיוק, תיעוד, העברה לאדם ועמידה בדרישות פרטיות. הלקח המרכזי: הטמעה חכמה מתחילה במדידה קשוחה, פיילוט מוגבל ובקרת איכות.

קרא עוד
ProFit ב-SFT: איך אימון ממוקד משפר מודלי שפה
מחקר
6 דקות
מ־arXiv cs.AI

ProFit ב-SFT: איך אימון ממוקד משפר מודלי שפה

**ProFit הוא מנגנון לאימון מפוקח של מודלי שפה שמפחית התאמת-יתר לניסוח יחיד באמצעות מיסוך טוקנים בעלי הסתברות נמוכה.** לפי תקציר המחקר ב-arXiv, השיטה שיפרה ביצועים במשימות היגיון ומתמטיקה בלי להישען על איסוף יקר של כמה תשובות לכל דוגמה. עבור עסקים בישראל, המשמעות פרקטית: במקום לאמן מודל על תשובות תבניתיות שנשברות בעברית יומיומית, אפשר להתמקד באותות הלשוניים שבאמת נושאים כוונה. זה רלוונטי במיוחד למערכות שמחברות AI Agents, WhatsApp Business API, Zoho CRM ו-N8N עבור שירות, מכירות ותיאום פגישות.

קרא עוד
המחשה אינטראקטיבית ב-ChatGPT ללימודי מתמטיקה ומדעים
ניתוח
6 דקות
מ־TechCrunch

המחשה אינטראקטיבית ב-ChatGPT ללימודי מתמטיקה ומדעים

**המחשה אינטראקטיבית ב-ChatGPT היא דרך חדשה להסביר מושגים דרך שינוי משתנים בזמן אמת, ולא רק באמצעות טקסט.** OpenAI פתחה את היכולת לכל משתמש מחובר, עם יותר מ-70 נושאי מתמטיקה ומדעים, ובכך מאותתת על שינוי רחב יותר בממשקי בינה מלאכותית. עבור עסקים בישראל, המשמעות חורגת מחינוך: אותה גישה יכולה לשפר הדרכת עובדים, הסבר ללקוחות, סימולציות מכירה ותהליכי שירות. הערך האמיתי נוצר כשהמחשה כזו מתחברת ל-WhatsApp Business API, ל-Zoho CRM ול-N8N, כך שהמשתמש לא רק מבין טוב יותר — אלא גם מתקדם לפעולה, עם תיעוד ונתונים בתוך התהליך.

קרא עוד
Phi-4-reasoning-vision-15B: מודל חזון-שפה קטן לעסקים
ניתוח
6 דקות
מ־Microsoft Research

Phi-4-reasoning-vision-15B: מודל חזון-שפה קטן לעסקים

**Phi-4-reasoning-vision-15B הוא מודל חזון-שפה פתוח בגודל 15B שמכוון לאיזון בין דיוק, מהירות ועלות חישוב.** לפי מיקרוסופט, הוא אומן על 200 מיליארד טוקנים בלבד ועדיין מציג ביצועים תחרותיים במשימות כמו קריאת מסמכים, ניתוח מסכים, OCR, מתמטיקה ומדע. מבחינת עסקים בישראל, הערך האמיתי הוא היכולת לשלב מודל כזה בתהליכים כמו קליטת מסמכים ב-WhatsApp, חילוץ נתונים, עדכון Zoho CRM ובקרת זרימה דרך N8N. ההמלצה הפרקטית: לא לרדוף רק אחרי המודל הגדול ביותר, אלא לבדוק בפיילוט מדדי דיוק, latency ועלות לכל מסמך או מסך אמיתי מתוך תהליך עסקי.

קרא עוד
TATRA להתאמת פרומפטים ללא דאטה: מה זה נותן לעסקים
מחקר
6 דקות
מ־arXiv cs.AI

TATRA להתאמת פרומפטים ללא דאטה: מה זה נותן לעסקים

**TATRA היא שיטה לבניית פרומפטים דינמיים לכל בקשה בודדת, בלי סט אימון מתויג ובלי חיפוש איטרטיבי יקר.** לפי המאמר ב-arXiv, היא מייצרת דוגמאות few-shot בזמן אמת ומשיגה תוצאות חזקות בסיווג טקסט ואף ביצועים מובילים ב-GSM8K וב-DeepMath. עבור עסקים בישראל, המשמעות היא אפשרות לבנות תהליכי AI יציבים יותר גם בלי צוות דאטה גדול: למשל חיבור בין WhatsApp Business API, ‏Zoho CRM ו-N8N שמעשיר כל פנייה בהקשר שונה. זה רלוונטי במיוחד לענפים כמו ביטוח, נדל"ן ומרפאות, שבהם הקלט בעברית רועש ולא אחיד, וכל טעות ניתוב עולה בזמן, בכסף ולעיתים גם באובדן ליד.

קרא עוד
Phi-4-reasoning-vision-15B: מודל קטן עם היגיון חזותי
מחקר
6 דקות
מ־arXiv cs.AI

Phi-4-reasoning-vision-15B: מודל קטן עם היגיון חזותי

**Phi-4-reasoning-vision-15B הוא מודל מולטימודלי פתוח במשקלות של 15 מיליארד פרמטרים, שמראה כי איכות דאטה וארכיטקטורת vision מדויקת יכולות להיות חשובות יותר מגודל המודל.** לפי הדוח הטכני ב-arXiv, Microsoft השיגה שיפור דרך סינון נתונים, תיקון שגיאות, העשרה סינתטית ומעבר למקודדים ברזולוציה דינמית. עבור עסקים בישראל, המשמעות היא שאפשר לבחון פרויקטים של ניתוח מסמכים, צילומי מסך וטפסים בלי להתחיל מתקציבי ענן עצומים. הערך האמיתי מגיע כשמחברים את המודל ל-WhatsApp Business API, ל-Zoho CRM ול-N8N, מודדים דיוק על 100-200 פריטים אמיתיים ומתרגמים זיהוי חזותי לפעולה עסקית מלאה.

קרא עוד
SSR להכוונת מודלים במתמטיקה: למה דוגמאות לא תמיד עובדות
מחקר
6 דקות
מ־arXiv cs.AI

SSR להכוונת מודלים במתמטיקה: למה דוגמאות לא תמיד עובדות

**יכולת ביצוע אסטרטגיה היא המדד שקובע אם דוגמה או Prompt באמת משפרים מודל בזמן אמת, ולא רק נראים נכונים.** מחקר חדש ב-arXiv מציג את SSR, מסגרת שבוחרת ומשלבת אסטרטגיות לפי מקור ואפקטיביות בפועל, עם שיפור של עד 13 נקודות ב-AIME25 ועד 5 נקודות ב-Apex. עבור עסקים בישראל, הלקח חשוב במיוחד בפרויקטים של AI Agents, WhatsApp Business API, Zoho CRM ו-N8N: לא מעתיקים תסריט כי הוא מרשים, אלא בודקים אם הוא מעלה דיוק, זמן תגובה או המרות. מי שמודד מסלולי הנחיה ברמת CRM ובונה פיילוט של 14 יום, מקטין סיכון ומקבל תמונה אמינה יותר על הערך העסקי.

קרא עוד
אימות פתרונות מתמטיים של LLM: למה בדיקת תשובה כבר לא מספיקה
מחקר
6 דקות
מ־arXiv cs.AI

אימות פתרונות מתמטיים של LLM: למה בדיקת תשובה כבר לא מספיקה

**אימות פתרונות מתמטיים של LLM הוא מעבר מבדיקת תשובה סופית לבדיקת דרך הפתרון עצמה.** זה הרעיון המרכזי במחקר חדש שפורסם ב-arXiv ומציע צינור עבודה עם Lean 4, שלושה סוכני AI ויכולת לאמת פתרונות גם באמצעות מודלים קטנים של עד 8B פרמטרים. עבור עסקים בישראל, המשמעות רחבה יותר ממתמטיקה: כל תהליך שבו AI מקבל החלטה — מתמחור ועד בדיקת זכאות — צריך להיבדק לפי שלבי ההסקה, לא רק לפי התוצאה. השילוב בין WhatsApp Business API, Zoho CRM, N8N וסוכני AI מאפשר לבנות תהליכים עם בקרה, תיעוד ועצירה אנושית בנקודות רגישות.

קרא עוד
LemmaBench: מדד חי למודלי שפה במתמטיקה מחקרית
ניתוח
6 דקות
מ־arXiv cs.AI

LemmaBench: מדד חי למודלי שפה במתמטיקה מחקרית

**LemmaBench הוא מדד חי שבודק מודלי שפה על מתמטיקה מחקרית עדכנית, ולא על אוסף שאלות ישן. לפי התקציר ב-arXiv, המודלים המובילים מגיעים כיום לדיוק של 10%-15% בלבד בהוכחת משפטים בניסיון ראשון.** עבור עסקים בישראל, זהו תמרור אזהרה חשוב: מודלי שפה מצוינים בניסוח, סיכום וסיווג, אך לא תמיד בהסקה אמינה בתהליכים מורכבים. לכן, כאשר מחברים AI ל-WhatsApp, ‏Zoho CRM או N8N, צריך לבנות בקרות, להגדיר אדם מאשר לכל פעולה רגישה, ולהתחיל בפיילוט מדוד. המסר המרכזי: לא לאמץ AI כ"קופסה שחורה", אלא כמרכיב בתוך תהליך מבוקר עם מדדי שגיאה ברורים.

קרא עוד
מערכת רב-סוכנית לגילוי מושגים מתמטיים: מה זה אומר לעסקים
מחקר
5 דקות
מ־arXiv cs.AI

מערכת רב-סוכנית לגילוי מושגים מתמטיים: מה זה אומר לעסקים

**מערכת רב-סוכנית לגילוי מושגים מתמטיים היא גישת AI שבה כמה סוכנים מעלים השערות, בודקים הוכחות ומעדכנים כיוון לפי משוב.** זהו הרעיון המרכזי במחקר חדש ב-arXiv, שהראה כיצד מערכת כזאת הצליחה לשחזר את מושג ההומולוגיה מתוך נתונים פוליהדרליים וידע באלגברה ליניארית. עבור עסקים בישראל, הלקח החשוב הוא לא המתמטיקה אלא המבנה: במקום בוט יחיד, מערכות AI יעילות יותר כשמחלקים את העבודה בין סוכנים, בדיקות ואינטגרציות. זה רלוונטי במיוחד לתהליכים שמחברים WhatsApp Business API, ‏Zoho CRM ו-N8N, שבהם אמינות, תיעוד ובקרה חשובים לא פחות מהתשובה עצמה.

קרא עוד
שאלות ביניים ל-LLM: איך ARQ משפר הסקה מורכבת
מחקר
6 דקות
מ־arXiv cs.AI

שאלות ביניים ל-LLM: איך ARQ משפר הסקה מורכבת

**שאלות ביניים ל-LLM הן שכבת עבודה שמפרקת משימה מורכבת לתת-שאלות לפני התשובה הסופית, וכך משפרת את איכות ההסקה.** מחקר ARQ שפורסם ב-arXiv מראה ששאלות כאלה לא רק קיימות, אלא גם ניתנות להעברה בין מודלים שונים ויכולות לסייע בפתרון משימות כמו מתמטיקה וקוד. עבור עסקים בישראל, המשמעות מעשית: במקום להחליף מיד למודל יקר יותר, אפשר לשפר תהליכים דרך orchestration נכון עם N8N, WhatsApp Business API ו-Zoho CRM. זה רלוונטי במיוחד למשרדי עורכי דין, נדל"ן, מרפאות וסוכנויות ביטוח שמנהלים תהליכים מרובי שלבים, מסמכים ושיחות.

קרא עוד
מחקר על vibe-proving: איך ChatGPT-5.2 מסייע בהוכחות
מחקר
5 דקות
מ־arXiv cs.AI

מחקר על vibe-proving: איך ChatGPT-5.2 מסייע בהוכחות

**vibe-proving הוא שימוש במודל שפה גדול כדי לסייע בחיפוש הוכחה, אך לא כדי להחליף אימות אנושי סופי.** זה המסר המרכזי ממאמר arXiv חדש, שתיעד 7 שיחות עם ChatGPT-5.2 ו-4 טיוטות בדרך לפתרון השערה מתמטית ספציפית. עבור עסקים בישראל, הלקח חשוב יותר מהמתמטיקה עצמה: AI מספק ערך גבוה בשלב הטיוטה, הסינתזה והחיפוש, אבל שלבים קריטיים חייבים להישאר תחת בקרת מומחה. לכן היישום הנכון אינו "לתת ל-AI לעבוד לבד", אלא לבנות זרימת עבודה עם לוגים, אישורים ואינטגרציה בין WhatsApp, CRM ו-N8N.

קרא עוד
הסקה נוירו-סימבולית מונחית אונטולוגיה: שיפור אמינות מודלי שפה במתמטיקה
מחקר
6 דקות
מ־arXiv cs.AI

הסקה נוירו-סימבולית מונחית אונטולוגיה: שיפור אמינות מודלי שפה במתמטיקה

**הסקה נוירו-סימבולית מונחית אונטולוגיה** היא דרך לצמצם הזיות של מודלי שפה באמצעות הזרקת הגדרות פורמליות מאונטולוגיה (כמו OpenMath) לתוך הפרומפט דרך RAG. לפי מאמר arXiv:2602.17826v1, בבנצ’מרק MATH ההקשר האונטולוגי משפר תוצאות רק כשאיכות האחזור והדירוג (כולל reranking עם Cross-Encoder) גבוהה; כאשר נשלף מידע לא רלוונטי, הוא פוגע בביצועים. לעסקים בישראל זה שיעור ישיר: ביישומי WhatsApp Business API, Zoho CRM וזרימות N8N, לא מספיק “לצרף מסמכים” – צריך מילון מושגים מאושר, מדידת איכות אחזור ודירוג קפדני. התחילו בפיילוט של 30–50 מושגים יקרים לטעות, מדדו 100 שאלות אמיתיות, ורק אז הרחיבו.

קרא עוד
M2F: פורמליזציה אוטומטית של ספרי מתמטיקה בקנה מידה גדול
מחקר
5 דקות
מ־arXiv cs.AI

M2F: פורמליזציה אוטומטית של ספרי מתמטיקה בקנה מידה גדול

**M2F היא מסגרת סוכנית שממירה ספרי מתמטיקה שלמים ל-Lean תוך 3 שבועות.** היא משיגה 96% הצלחה ומדגימה סקיילינג אוטומטי. לעסקים ישראליים, זה פותח אוטומציה של מודלים עסקיים בלוגיסטיקה ופיננסים, עם חיסכון של 70% בזמן פיתוח.

קרא עוד
SELFCEST: קלונים מקבילים משפרים חשיבה במודלי AI
מחקר
5 דקות
מ־arXiv cs.AI

SELFCEST: קלונים מקבילים משפרים חשיבה במודלי AI

**SELFCEST משפרת מודלי AI עם קלונים מקבילים תחת תקציב חישוב קבוע.** מאמר חדש ב-arXiv מראה שיפור 25% במתמטיקה ו-QA. לעסקים ישראלים, זה אומר תגובות מהירות יותר בוואטסאפ ו-Zoho, חיסכון ₪2,000+ חודשי.

קרא עוד
פרדוקס הפרלקסיות: מדוע קוד מדחס טוב יותר ממתמטיקה ב-LLM
מחקר
5 דקות
מ־arXiv cs.AI

פרדוקס הפרלקסיות: מדוע קוד מדחס טוב יותר ממתמטיקה ב-LLM

**פרדוקס הפרלקסיות בדחיסת פרומפטים: סינטקס קוד נשמר, מספרים מתמטיים נמחקים.** מחקר חדש מאמת על בנצ'מרקים מרובים ומציג TAAC שחוסך 22% בעלויות עם 96% איכות. לעסקים ישראלים: אופטימיזציה חיונית לאוטומציה ב-N8N ו-Zoho CRM, חיסכון ₪2,000+ לחודש.

קרא עוד
ALIVE: מעירה חשיבה מתקדמת במודלי שפה גדולים
מחקר
2 דקות
מ־arXiv cs.AI

ALIVE: מעירה חשיבה מתקדמת במודלי שפה גדולים

בעידן שבו מודלי שפה גדולים נתקלים בקושי להגיע לרמת חשיבה של מומחים, חוקרים מציגים את ALIVE – מסגרת אימון פורצת דרך שמתגברת על בעיית התגמולים ומשפרת ביצועים במתמטיקה, קוד ולוגיקה. קראו את הניתוח המלא עכשיו! (112 מילים)

קרא עוד