חיפוש בחדשות

30 תוצאות עבור "Qwen".

מחירי הטוקנים לא יעלו אם תארחו בעצמכם מודלי שפה
ניתוח
6 דקות
מ־n8n

מחירי הטוקנים לא יעלו אם תארחו בעצמכם מודלי שפה

בבלוג של n8n מוסבר כי מחירי הטוקנים של מודלי שפה גדולים (LLMs) בענן מסובסדים כיום וככל הנראה יעלו בעתיד. כדי להתמודד עם העלויות המשתנות, ארגונים יכולים לאמץ אירוח עצמי (Self-hosting) של מודלים מקומיים. המעבר לאירוח עצמי מציע יתרונות משמעותיים של שליטה, פרטיות, ומניעת נקודות כשל ברשת, לצד אתגרים תפעוליים כגון ניהול משאבים, אבטחת שרשרת האספקה והגדרת תצורות. המאמר סוקר את אפשרויות התשתית (כגון RunPod ו-Lambda Labs), סביבות ההרצה (כגון vLLM ו-Ollama), ואת מגוון המודלים הפתוחים הזמינים כיום (כגון Llama ו-Qwen).

קרא עוד
אימון מיומנויות של סוכני AI: הכירו את SkillOpt של מיקרוסופט
מחקר
4 דקות
מ־Microsoft Research

אימון מיומנויות של סוכני AI: הכירו את SkillOpt של מיקרוסופט

מחקר חדש של Microsoft Research (זרוע המחקר של מיקרוסופט) מציג את SkillOpt (מערכת אופטימיזציה למיומנויות סוכני AI), גישה חדשנית ההופכת את תהליך כתיבת הפרומפטים לאימון פרמטרי מבוקר. המערכת שומרת על משקלי מודל השפה קפואים, ומאמנת שכבת מיומנויות טקסטואלית חיצונית באמצעות לולאת משוב המנתחת הצלחות וכישלונות. במבחני ביצועים מול מודלים מובילים כמו GPT-5.5, המערכת הציגה שיפור ממוצע של 23.5 נקודות במשימות מורכבות, ואיפשרה למודלים קטנים וזולים כמו Qwen3.5-4B לעקוף את ביצועי הבסיס של מודלים גדולים בהרבה ללא מיומנויות מותאמות.

קרא עוד
פריצת דרך בבינה מלאכותית: טכנולוגיית קשב דליל למודלי שפה של Subquadratic
מחקר
4 דקות
מ־MIT Technology Review

פריצת דרך בבינה מלאכותית: טכנולוגיית קשב דליל למודלי שפה של Subquadratic

חברת הסטארט-אפ Subquadratic מציגה פריצת דרך מתמטית בארכיטקטורת מודלי השפה בעזרת פיתוח מודל SubQ המבוסס על מנגנון קשב דליל דינמי. על פי הערכה עצמאית של חברת Appen, המודל החדש מציג מהירות עיבוד גבוהה פי 56 מטכנולוגיית FlashAttention, תוך שמירה על רמת דיוק של 98% במבחני שליפת מידע מחלון הקשר עצום של 12 מיליון טוקנים. בנוסף, החברה מדווחת על הפחתת עלויות דרמטית של הפעלת המודל - 8 דולרים בלבד בהשוואה ל-2,600 דולר במודלים מובילים מקבילים עבור משימות ארוכות. אף על פי שהמודל טרם שוחרר לציבור הרחב ומבוסס בחלקו על משקולות מודל Qwen הסיני, התוצאות מציבות חלופה מבטיחה לארכיטקטורת ה-Transformer המסורתית.

קרא עוד
פגיעות פרטיות ב-VLM מקומי: למה גם עיבוד על המכשיר לא מספיק
מחקר
6 דקות
מ־arXiv cs.AI

פגיעות פרטיות ב-VLM מקומי: למה גם עיבוד על המכשיר לא מספיק

**מודל Vision-Language מקומי אינו מבטיח פרטיות מלאה.** מחקר חדש על LLaVA-NeXT ו-Qwen2-VL מראה כי גם בלי גישה לקבצים עצמם, אפשר להסיק מתזמון עיבוד ומעומס מטמון אם המערכת טיפלה במסמך, צילום רפואי או תוכן חזותי צפוף אחר. עבור עסקים בישראל, המשמעות ברורה: הרצה על המכשיר מפחיתה סיכוני ענן, אבל מחייבת בדיקת ערוצי צד, הרשאות תחנה, לוגים וחיבורי API. ארגונים שמחברים VLM מקומי ל-Zoho CRM, ל-WhatsApp Business API או לזרימות N8N צריכים לבחון לא רק איפה הנתון נשמר, אלא גם אילו אותות טכניים נפלטים בזמן העיבוד.

קרא עוד
משימות סינתטיות לסוכני מחקר AI: איך הביצועים עלו ב-12%
מחקר
6 דקות
מ־arXiv cs.AI

משימות סינתטיות לסוכני מחקר AI: איך הביצועים עלו ב-12%

**משימות סינתטיות לסוכני מחקר AI הן שיטת אימון שמלמדת מודלים לבצע משימות אמיתיות, לא רק לנסח תשובות משכנעות.** לפי מחקר חדש ב-arXiv, שימוש במשימות סינתטיות שיפר את מדד AUP ב-9% עבור Qwen3-4B וב-12% עבור Qwen3-8B על בנצ'מרק MLGym. עבור עסקים בישראל, זה רלוונטי משום שהשוק עובר מצ'אטבוטים לסוכנים שמסוגלים לבדוק נתונים, להפעיל תהליכים וללמוד מתוצאות. המשמעות המעשית: לפני שמחברים סוכן ל-WhatsApp, ל-Zoho CRM או ל-N8N, צריך סביבת בדיקה סינתטית, לוגים והרשאות. מי שיאמן סוכנים על תרחישי עבודה אמיתיים ישיג תוצאות יציבות יותר בשירות, מכירות ותפעול.

קרא עוד
מודלי Qwen קטנים לעסקים: מה עזיבת מוביל הפיתוח באליבאבא מסמנת
ניתוח
6 דקות
מ־TechCrunch

מודלי Qwen קטנים לעסקים: מה עזיבת מוביל הפיתוח באליבאבא מסמנת

**מודלי Qwen 3.5 קטנים הם מודלים פתוחי-משקל של Alibaba שמיועדים להרצה קלה יותר ולבניית סוכנים בסיסיים, אך עזיבת מוביל הפיתוח Junyang Lin יום אחרי ההשקה מעלה שאלות על יציבות המוצר ולא רק על ביצועים.** לפי TechCrunch, Alibaba הציגה ארבעה מודלים חדשים בטווח 0.8B עד 9B פרמטרים. עבור עסקים בישראל, הלקח אינו להתרגש רק ממבחני ביצועים, אלא לבדוק רציפות צוות, תמיכה, רישוי ותוכנית fallback. מי שבונה תהליכים עם WhatsApp Business API, Zoho CRM, N8N ו-AI Agents צריך ארכיטקטורה גמישה שמאפשרת להחליף מודל בלי לפגוע בשירות, בלידים או בעמידה בדרישות פרטיות.

קרא עוד
יישור בזמן היסק בדלילות: איך SIA חוסכת עד פי 6 בעלות
מחקר
6 דקות
מ־arXiv cs.AI

יישור בזמן היסק בדלילות: איך SIA חוסכת עד פי 6 בעלות

**יישור בזמן היסק דליל הוא שיטה שמכוונת מודל שפה רק בצמתי החלטה חשובים, במקום להתערב בכל טוקן.** לפי המחקר החדש על SIA, התערבות ב-20% עד 80% מהטוקנים יכולה לשפר את היחס בין איכות יישור לעלות, ובמקרים מסוימים אף להשתוות למודלי instruct חזקים יותר, תוך חיסכון חישובי של עד פי 6. עבור עסקים בישראל שבונים תהליכי שירות, מכירות ותפעול עם Qwen, Llama או GPT, המשמעות היא אפשרות להקטין latency ועלות בלי לוותר על שליטה. החיבור המעשי הוא לשכבת האינטגרציה: WhatsApp Business API, Zoho CRM ו-N8N, שם ניתן ליישם בקרה ממוקדת דווקא בהחלטות עסקיות רגישות.

קרא עוד
ProactiveMobile: מדד חדש לסוכנים פרואקטיביים במובייל
מחקר
6 דקות
מ־arXiv cs.AI

ProactiveMobile: מדד חדש לסוכנים פרואקטיביים במובייל

**ProactiveMobile הוא מדד חדש שבודק אם סוכן AI במובייל מסוגל להסיק כוונת משתמש סמויה וליזום פעולה בלי הוראה מפורשת.** לפי המחקר, המדד כולל 3,660 דוגמאות, 14 תרחישים ו-63 APIs, והתוצאה הבולטת היא שמודלים מובילים עדיין מתקשים מאוד במשימה: Qwen2.5-VL-7B-Instruct הגיע ל-19.15% הצלחה, o1 ל-15.71%, ו-GPT-5 ל-7.39%. מבחינת עסקים בישראל, המשמעות אינה "סוכן אוטונומי מלא" אלא בנייה של תהליכים יזומים עם בקרה: זיהוי כוונה, בדיקת הרשאות, ואז ביצוע דרך WhatsApp Business API, Zoho CRM ו-N8N. זה רלוונטי במיוחד למרפאות, נדל"ן, ביטוח ומשרדי עורכי דין.

קרא עוד
מחקר חדש: האם תמונות משפרות שיפוטי שפה של מודלי AI?
מחקר
6 דקות
מ־arXiv cs.AI

מחקר חדש: האם תמונות משפרות שיפוטי שפה של מודלי AI?

**שיפוט תקינות משפטים בהקשר מולטימודלי בודק האם תמונה משנה את האופן שבו בני אדם ומודלי שפה מעריכים משפט. לפי מחקר חדש, אצל בני אדם ההשפעה כמעט לא קיימת, ואילו אצל LLMs היא קיימת אך לא בהכרח משפרת דיוק.** המשמעות לעסקים בישראל ברורה: אם אתם בונים תהליך שמחבר תמונות, טקסט ותגובה אוטומטית ב-WhatsApp או ב-CRM, אל תניחו שמידע חזותי משפר בהכרח את איכות הניסוח. במקרים רבים נכון להפריד בין חילוץ נתונים מהתמונה לבין בדיקת השפה עצמה. זה חשוב במיוחד במשרדי עורכי דין, מרפאות, ביטוח ונדל"ן, שבהם זורמים גם מסמכים מצולמים וגם טקסט חופשי.

קרא עוד
Qwen-BIM לתכנון מבוסס BIM: למה מודל 14B מאתגר ענקים
מחקר
6 דקות
מ־arXiv cs.AI

Qwen-BIM לתכנון מבוסס BIM: למה מודל 14B מאתגר ענקים

**Qwen-BIM הוא הוכחה לכך שמודל שפה ייעודי עם benchmark ודאטה נכונים יכול לגבור על מודל כללי גדול בהרבה במשימה מקצועית.** לפי המחקר, המודל שיפר ב-21% את ציון G-Eval לעומת מודל הבסיס, ואף הציג ביצועים דומים למודלים של 671B פרמטרים למרות שהוא כולל 14B בלבד. עבור עסקים בישראל, הלקח רחב יותר מעולם הבנייה: במקום להסתפק ב-ChatGPT גנרי, עדיף לעיתים לבנות מודל ממוקד משימה סביב מסמכים, CRM וזרימות עבודה. מי שמחבר בין AI Agents, WhatsApp Business API, Zoho CRM ו-N8N יכול להפוך תשובות אוטומטיות לפעולה עסקית מדידה.

קרא עוד
הטיה בין-מודאלית במודלים רב-מודאליים: מה המחקר החדש מלמד
מחקר
5 דקות
מ־arXiv cs.AI

הטיה בין-מודאלית במודלים רב-מודאליים: מה המחקר החדש מלמד

**הטיה בין-מודאלית במודלים רב-מודאליים היא מצב שבו ערוץ קלט אחד, כמו קול או תמונה, מקבל בפועל משקל גבוה מדי בהחלטת המודל.** מאמר עמדה חדש ב-arXiv טוען שזה בדיוק מה שעלול לקרות גם במודלים כמו Qwen2.5-Omni ו-Gemma 3n: במקום שמספר מודאליות יאזנו זו את זו, אחת מהן עשויה לשלוט ולהטות את התוצאה. עבור עסקים בישראל, המשמעות מעשית מאוד: כל מערכת שמנתחת הודעות WhatsApp, שיחות, מסמכים ונתוני CRM צריכה בדיקות נפרדות לדומיננטיות בין ערוצים. ההמלצה המרכזית היא להריץ פיילוט מבוקר, למדוד שינויי החלטה כשמבטלים כל מודאליות בנפרד, ולתעד הכול ב-Zoho CRM או מערכת דומה דרך N8N.

קרא עוד
סמנטיק צ׳אנקינג למסמכים ארוכים: מהפך במהירות ובדיוק
מחקר
6 דקות
מ־arXiv cs.AI

סמנטיק צ׳אנקינג למסמכים ארוכים: מהפך במהירות ובדיוק

**סמנטיק צ׳אנקינג למסמכים ארוכים הוא חלוקה של טקסט לפי נושא, לא לפי אורך קבוע.** זה חשוב כי איכות האחזור במערכות RAG תלויה ישירות באיכות המקטעים. במחקר חדש ב-arXiv, מודל דיסקרימינטיבי מבוסס Qwen3-0.6B תומך בעד 13 אלף טוקנים לקלט יחיד ומציג, לפי הדיווח, מהירות הסקה גבוהה פי 100 לעומת שלוש חלופות גנרטיביות מבוססות Qwen2-0.5B של Jina. עבור עסקים בישראל, המשמעות היא פוטנציאל ממשי לבנות מנועי חיפוש וידע טובים יותר למסמכים משפטיים, תיעוד שירות ונהלים, במיוחד כשהם מחוברים ל-Zoho CRM, ל-WhatsApp Business API ול-N8N.

קרא עוד
MMKG-RDS לסינתזת נתוני אימון: מה זה אומר לעסקים
מחקר
5 דקות
מ־arXiv cs.AI

MMKG-RDS לסינתזת נתוני אימון: מה זה אומר לעסקים

**MMKG-RDS היא מסגרת לסינתזה של נתוני אימון עבור משימות reasoning, המבוססת על גרפי ידע מולטימודליים ומכוונת לשפר את איכות הדאטה יותר מאשר רק לבחור מודל חזק יותר.** לפי המאמר, כוונון מודלי Qwen3 על מספר קטן של דוגמאות מסונתזות שיפר דיוק ב-9.2%, על פני בנצ'מרק של 14,950 דוגמאות ב-5 תחומים ו-17 סוגי משימות. עבור עסקים בישראל, המשמעות ברורה: אם אתם מפעילים שירות, מכירות או תפעול על בסיס מסמכים, טבלאות ונוסחאות, כדאי להשקיע בבנצ'מרק פרטי, חיבור ל-CRM ובדיקות דרך N8N ו-WhatsApp Business API, ולא רק בבחירת מודל.

קרא עוד
EvoTool לאופטימיזציית כלי ב-LLM: מה זה אומר לעסקים
מחקר
6 דקות
מ־arXiv cs.AI

EvoTool לאופטימיזציית כלי ב-LLM: מה זה אומר לעסקים

**EvoTool הוא מחקר שמציע דרך מדויקת יותר לשפר את האופן שבו סוכני LLM מפעילים כלים חיצוניים.** במקום לעדכן את כל הסוכן כמקשה אחת, הוא מפרק את העבודה ל-4 מודולים — Planner, Selector, Caller ו-Synthesizer — ומשפר רק את הרכיב שנכשל. לפי התקציר ב-arXiv, השיטה השיגה שיפור של יותר מ-5 נקודות ב-4 בנצ'מרקים על GPT-4.1 ו-Qwen3-8B. עבור עסקים בישראל, המשמעות פרקטית: אם אתם מחברים סוכן ל-WhatsApp Business API, Zoho CRM ו-N8N, כדאי לבנות תהליך מודולרי שאפשר לנטר, לבדוק ולשפר שלב אחר שלב, במיוחד בענפים כמו מרפאות, נדל"ן וביטוח.

קרא עוד
זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף
מחקר
6 דקות
מ־arXiv cs.AI

זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף

**Spilled Energy הוא מדד חדש לזיהוי הלוצינציות במודלי שפה גדולים, המבוסס על logits בזמן יצירה ואינו דורש אימון נוסף.** לפי מחקר חדש ב-arXiv, המדד נבדק על 9 בנצ'מרקים ובמודלים כמו LLaMA, Mistral, Gemma ו-Qwen3, והראה יכולת תחרותית בזיהוי שגיאות עובדתיות והטיות. עבור עסקים בישראל, המשמעות היא אפשרות לבנות שכבת בקרה מעל עוזרי AI, מערכות WhatsApp ו-CRM, כך שתשובות בסיכון גבוה לא יישלחו אוטומטית. זה רלוונטי במיוחד למשרדי עורכי דין, מרפאות, ביטוח וחנויות אונליין שמחברים AI Agents, Zoho CRM, WhatsApp Business API ו-N8N לתהליכי שירות ומכירה.

קרא עוד
Nanbeige4.1-3B: מודל 3B שמבצע סוכנות, קוד והסקה במודל אחד
מחקר
6 דקות
מ־arXiv cs.AI

Nanbeige4.1-3B: מודל 3B שמבצע סוכנות, קוד והסקה במודל אחד

**Nanbeige4.1-3B הוא מודל שפה קטן (3B פרמטרים) שמנסה לאחד במודל אחד יכולות של סוכן עם שימוש בכלים, יצירת קוד והסקה כללית. לפי המאמר ב-arXiv (2602.13367v1), האימון מכוון לאינטראקציות יציבות לטווח ארוך ומדווח על יכולת להגיע עד 600 תורות של קריאות לכלים — נתון שמעניין במיוחד עסקים שבונים תהליכים רב-שלביים.** לעסקים בישראל המשמעות יכולה להיות פריסה זולה יותר וקרובה יותר לנתונים (שרת פרטי/ענן פרטי), מה שמקטין חשיפה של מידע לקוחות ומקל על ציות. השילוב המתבקש בשטח הוא תזמור תהליכים ב‑N8N יחד עם Zoho CRM ו‑WhatsApp Business API, כדי לסגור מעגל “ליד → בדיקה → תיאום → עדכון CRM” עם פחות לוגיקה ידנית ויותר עקביות.

קרא עוד
ניתוח שגיאות בשרשרת כלי MCP: למה העיוות גדל ליניארית ולא מתפוצץ
מחקר
6 דקות
מ־arXiv cs.AI

ניתוח שגיאות בשרשרת כלי MCP: למה העיוות גדל ליניארית ולא מתפוצץ

**שגיאות בסוכן LLM שמבצע שרשרת קריאות לכלים (MCP) לא חייבות “להתפוצץ”.** לפי arXiv:2602.13320v1, העיוות המצטבר גדל בקירוב ליניארי עם מספר הצעדים T, והסטיות סביב המגמה נשלטות בהסתברות גבוהה בגבול O(√T). בניסויים על Qwen2-7B, Llama-3-8B ו-Mistral-7B, המדידות עקבו אחרי המודל התיאורטי; שקלול סמנטי במדד הפחית עיוות בכ-80%, וריענון מקור אמת (“re-grounding”) כל ~9 צעדים הספיק לבקרת שגיאות. לעסקים בישראל שמחברים WhatsApp Business API ל-Zoho CRM דרך N8N, זה מתרגם לכלל עבודה: לקבוע נקודות בדיקה מחזוריות מול ה-CRM לפני פעולות קריטיות כמו תמחור, קביעת פגישה או הפקת מסמך.

קרא עוד
כימות PTQ ל-LLM חשיבתי על Ascend NPU: מה עובד ב-4bit ומה קורס
מחקר
6 דקות
מ־arXiv cs.AI

כימות PTQ ל-LLM חשיבתי על Ascend NPU: מה עובד ב-4bit ומה קורס

כימות PTQ (Post‑Training Quantization) הוא דרך לדחוס מודל שפה אחרי אימון ל-INT8/INT4 כדי להקטין זיכרון ולשפר ביצועים בפריסה. לפי arXiv:2602.17693v1 שבחן מודלי reasoning כמו DeepSeek-R1-Distill-Qwen (1.5B/7B/14B) ו-QwQ-32B על Ascend NPU, מתקבלת רגישות פלטפורמה מובהקת: INT8 נשאר יציב מספרית, בעוד שכימות 4bit אגרסיבי למשקולות+אקטיבציות עלול ליצור חוסר יציבות בכיול שכבות ולהוביל ל״קריסת לוגיקה״ בהקשר ארוך. לעסקים בישראל שמפעילים תהליכים מבוססי WhatsApp ו-CRM, ההמלצה הפרקטית היא להתחיל ב-INT8, לבנות סט בדיקות הקשר ארוך אמיתי מהדאטה שלכם, ורק אחר כך לשקול 4bit weight-only עם מדידת ביצועים מקצה לקצה (כולל overhead של dynamic quantization).

קרא עוד
דיסטילציית CoT יעילה עם GRPO: קיצור הסבר בלי לאבד דיוק
מחקר
6 דקות
מ־arXiv cs.AI

דיסטילציית CoT יעילה עם GRPO: קיצור הסבר בלי לאבד דיוק

**דיסטילציית Chain-of-Thought (CoT) יעילה מאפשרת ללמד מודל קטן לבצע נימוק רב-שלבי כמו מודל גדול, אבל להוציא תשובה קצרה שמתאימה לערוצי שירות ומכירה.** לפי arXiv:2602.17686v1, קוריקולום בן 3 שלבים (מסיכות מבניות, אופטימיזציה עם GRPO, ושכתוב ממוקד של מקרי כשל) העלה את הדיוק של Qwen2.5-3B-Base ב-11.29% והקטין את אורך הפלט ב-27.4% על GSM8K. לעסקים בישראל זה מתרגם ישירות לעלויות טוקנים ולחוויית לקוח, במיוחד בשירות ב-WhatsApp. ההמלצה המעשית: להפריד בין “נימוק חיצוני” קצר ללקוח לבין לוג מלא ב-Zoho CRM, ולהפעיל את הזרימה דרך N8N כדי למדוד זמן תגובה ושיעור פתרון בפנייה ראשונה.

קרא עוד
מודל תגמול ללא הרצה לקוד: CodeScaler מאיץ אימון והסקה ב-LLM
מחקר
6 דקות
מ־arXiv cs.AI

מודל תגמול ללא הרצה לקוד: CodeScaler מאיץ אימון והסקה ב-LLM

**CodeScaler הוא מודל תגמול ללא הרצה (execution-free) ליצירת קוד, שמחליף תלות ב-unit tests בדירוג איכות שנלמד מנתוני העדפות. לפי תקציר המאמר, הוא שיפר את Qwen3-8B-Base בממוצע ב-+11.72 נקודות בחמישה בנצ׳מרקים, ובזמן inference סיפק פי-10 פחות השהיה תוך ביצועים דומים לגישות unit test.** לעסקים בישראל זה חשוב במיוחד בפרויקטים כמו N8N, Zoho CRM ו-WhatsApp Business API, שבהם כמעט אין כיסוי בדיקות מלא אבל כל שינוי משפיע על מכירות ושירות. המשמעות המעשית: אפשר לקבל איכות גבוהה יותר ליצירת קוד/זרימות אוטומציה בלי להקים סביבות הרצה כבדות, ולהקטין סיכוני חשיפת מידע כשבודקים על דאטה רגיש.

קרא עוד
מודלי AI לומדים בעצמם: שואלים שאלות ומשפרים יכולות
מחקר
4 דקות
מ־Wired

מודלי AI לומדים בעצמם: שואלים שאלות ומשפרים יכולות

בעידן שבו מודלי הבינה המלאכותית החכמים ביותר עדיין מחקים בני אדם, חוקרים מציגים גישה חדשנית: AI ששואל שאלות לעצמו ומתאמן באופן עצמאי. פרויקט AZR מדגים שיפור משמעותי במודלי Qwen. קראו עכשיו כדי להבין את ההשלכות העסקיות! (112 מילים)

קרא עוד