חיפוש בחדשות

9 תוצאות עבור "Qwen3".

אימון מיומנויות של סוכני AI: הכירו את SkillOpt של מיקרוסופט
מחקר
4 דקות
מ־Microsoft Research

אימון מיומנויות של סוכני AI: הכירו את SkillOpt של מיקרוסופט

מחקר חדש של Microsoft Research (זרוע המחקר של מיקרוסופט) מציג את SkillOpt (מערכת אופטימיזציה למיומנויות סוכני AI), גישה חדשנית ההופכת את תהליך כתיבת הפרומפטים לאימון פרמטרי מבוקר. המערכת שומרת על משקלי מודל השפה קפואים, ומאמנת שכבת מיומנויות טקסטואלית חיצונית באמצעות לולאת משוב המנתחת הצלחות וכישלונות. במבחני ביצועים מול מודלים מובילים כמו GPT-5.5, המערכת הציגה שיפור ממוצע של 23.5 נקודות במשימות מורכבות, ואיפשרה למודלים קטנים וזולים כמו Qwen3.5-4B לעקוף את ביצועי הבסיס של מודלים גדולים בהרבה ללא מיומנויות מותאמות.

קרא עוד
משימות סינתטיות לסוכני מחקר AI: איך הביצועים עלו ב-12%
מחקר
6 דקות
מ־arXiv cs.AI

משימות סינתטיות לסוכני מחקר AI: איך הביצועים עלו ב-12%

**משימות סינתטיות לסוכני מחקר AI הן שיטת אימון שמלמדת מודלים לבצע משימות אמיתיות, לא רק לנסח תשובות משכנעות.** לפי מחקר חדש ב-arXiv, שימוש במשימות סינתטיות שיפר את מדד AUP ב-9% עבור Qwen3-4B וב-12% עבור Qwen3-8B על בנצ'מרק MLGym. עבור עסקים בישראל, זה רלוונטי משום שהשוק עובר מצ'אטבוטים לסוכנים שמסוגלים לבדוק נתונים, להפעיל תהליכים וללמוד מתוצאות. המשמעות המעשית: לפני שמחברים סוכן ל-WhatsApp, ל-Zoho CRM או ל-N8N, צריך סביבת בדיקה סינתטית, לוגים והרשאות. מי שיאמן סוכנים על תרחישי עבודה אמיתיים ישיג תוצאות יציבות יותר בשירות, מכירות ותפעול.

קרא עוד
סמנטיק צ׳אנקינג למסמכים ארוכים: מהפך במהירות ובדיוק
מחקר
6 דקות
מ־arXiv cs.AI

סמנטיק צ׳אנקינג למסמכים ארוכים: מהפך במהירות ובדיוק

**סמנטיק צ׳אנקינג למסמכים ארוכים הוא חלוקה של טקסט לפי נושא, לא לפי אורך קבוע.** זה חשוב כי איכות האחזור במערכות RAG תלויה ישירות באיכות המקטעים. במחקר חדש ב-arXiv, מודל דיסקרימינטיבי מבוסס Qwen3-0.6B תומך בעד 13 אלף טוקנים לקלט יחיד ומציג, לפי הדיווח, מהירות הסקה גבוהה פי 100 לעומת שלוש חלופות גנרטיביות מבוססות Qwen2-0.5B של Jina. עבור עסקים בישראל, המשמעות היא פוטנציאל ממשי לבנות מנועי חיפוש וידע טובים יותר למסמכים משפטיים, תיעוד שירות ונהלים, במיוחד כשהם מחוברים ל-Zoho CRM, ל-WhatsApp Business API ול-N8N.

קרא עוד
MMKG-RDS לסינתזת נתוני אימון: מה זה אומר לעסקים
מחקר
5 דקות
מ־arXiv cs.AI

MMKG-RDS לסינתזת נתוני אימון: מה זה אומר לעסקים

**MMKG-RDS היא מסגרת לסינתזה של נתוני אימון עבור משימות reasoning, המבוססת על גרפי ידע מולטימודליים ומכוונת לשפר את איכות הדאטה יותר מאשר רק לבחור מודל חזק יותר.** לפי המאמר, כוונון מודלי Qwen3 על מספר קטן של דוגמאות מסונתזות שיפר דיוק ב-9.2%, על פני בנצ'מרק של 14,950 דוגמאות ב-5 תחומים ו-17 סוגי משימות. עבור עסקים בישראל, המשמעות ברורה: אם אתם מפעילים שירות, מכירות או תפעול על בסיס מסמכים, טבלאות ונוסחאות, כדאי להשקיע בבנצ'מרק פרטי, חיבור ל-CRM ובדיקות דרך N8N ו-WhatsApp Business API, ולא רק בבחירת מודל.

קרא עוד
EvoTool לאופטימיזציית כלי ב-LLM: מה זה אומר לעסקים
מחקר
6 דקות
מ־arXiv cs.AI

EvoTool לאופטימיזציית כלי ב-LLM: מה זה אומר לעסקים

**EvoTool הוא מחקר שמציע דרך מדויקת יותר לשפר את האופן שבו סוכני LLM מפעילים כלים חיצוניים.** במקום לעדכן את כל הסוכן כמקשה אחת, הוא מפרק את העבודה ל-4 מודולים — Planner, Selector, Caller ו-Synthesizer — ומשפר רק את הרכיב שנכשל. לפי התקציר ב-arXiv, השיטה השיגה שיפור של יותר מ-5 נקודות ב-4 בנצ'מרקים על GPT-4.1 ו-Qwen3-8B. עבור עסקים בישראל, המשמעות פרקטית: אם אתם מחברים סוכן ל-WhatsApp Business API, Zoho CRM ו-N8N, כדאי לבנות תהליך מודולרי שאפשר לנטר, לבדוק ולשפר שלב אחר שלב, במיוחד בענפים כמו מרפאות, נדל"ן וביטוח.

קרא עוד
זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף
מחקר
6 דקות
מ־arXiv cs.AI

זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף

**Spilled Energy הוא מדד חדש לזיהוי הלוצינציות במודלי שפה גדולים, המבוסס על logits בזמן יצירה ואינו דורש אימון נוסף.** לפי מחקר חדש ב-arXiv, המדד נבדק על 9 בנצ'מרקים ובמודלים כמו LLaMA, Mistral, Gemma ו-Qwen3, והראה יכולת תחרותית בזיהוי שגיאות עובדתיות והטיות. עבור עסקים בישראל, המשמעות היא אפשרות לבנות שכבת בקרה מעל עוזרי AI, מערכות WhatsApp ו-CRM, כך שתשובות בסיכון גבוה לא יישלחו אוטומטית. זה רלוונטי במיוחד למשרדי עורכי דין, מרפאות, ביטוח וחנויות אונליין שמחברים AI Agents, Zoho CRM, WhatsApp Business API ו-N8N לתהליכי שירות ומכירה.

קרא עוד
Nanbeige4.1-3B: מודל 3B שמבצע סוכנות, קוד והסקה במודל אחד
מחקר
6 דקות
מ־arXiv cs.AI

Nanbeige4.1-3B: מודל 3B שמבצע סוכנות, קוד והסקה במודל אחד

**Nanbeige4.1-3B הוא מודל שפה קטן (3B פרמטרים) שמנסה לאחד במודל אחד יכולות של סוכן עם שימוש בכלים, יצירת קוד והסקה כללית. לפי המאמר ב-arXiv (2602.13367v1), האימון מכוון לאינטראקציות יציבות לטווח ארוך ומדווח על יכולת להגיע עד 600 תורות של קריאות לכלים — נתון שמעניין במיוחד עסקים שבונים תהליכים רב-שלביים.** לעסקים בישראל המשמעות יכולה להיות פריסה זולה יותר וקרובה יותר לנתונים (שרת פרטי/ענן פרטי), מה שמקטין חשיפה של מידע לקוחות ומקל על ציות. השילוב המתבקש בשטח הוא תזמור תהליכים ב‑N8N יחד עם Zoho CRM ו‑WhatsApp Business API, כדי לסגור מעגל “ליד → בדיקה → תיאום → עדכון CRM” עם פחות לוגיקה ידנית ויותר עקביות.

קרא עוד
מודל תגמול ללא הרצה לקוד: CodeScaler מאיץ אימון והסקה ב-LLM
מחקר
6 דקות
מ־arXiv cs.AI

מודל תגמול ללא הרצה לקוד: CodeScaler מאיץ אימון והסקה ב-LLM

**CodeScaler הוא מודל תגמול ללא הרצה (execution-free) ליצירת קוד, שמחליף תלות ב-unit tests בדירוג איכות שנלמד מנתוני העדפות. לפי תקציר המאמר, הוא שיפר את Qwen3-8B-Base בממוצע ב-+11.72 נקודות בחמישה בנצ׳מרקים, ובזמן inference סיפק פי-10 פחות השהיה תוך ביצועים דומים לגישות unit test.** לעסקים בישראל זה חשוב במיוחד בפרויקטים כמו N8N, Zoho CRM ו-WhatsApp Business API, שבהם כמעט אין כיסוי בדיקות מלא אבל כל שינוי משפיע על מכירות ושירות. המשמעות המעשית: אפשר לקבל איכות גבוהה יותר ליצירת קוד/זרימות אוטומציה בלי להקים סביבות הרצה כבדות, ולהקטין סיכוני חשיפת מידע כשבודקים על דאטה רגיש.

קרא עוד