TOPIC

Speculative Decoding

כל החדשות והניתוחים שלנו בנושא Speculative Decoding — מתורגמים ומסוכמים ממקורות מובילים בעולם, עם הקשר עסקי ישראלי. 2 כתבות.

האצת מודלי בינה מלאכותית על המכשיר: החידוש של גוגל ב-MTP
מחקר
4 דקות
מ־Google Research

האצת מודלי בינה מלאכותית על המכשיר: החידוש של גוגל ב-MTP

חברת Google הציגה פריצת דרך בארכיטקטורת מחשוב הקצה של מכשירי Pixel 9 ו-Pixel 10 באמצעות שילוב טכנולוגיית Multi-Token Prediction (MTP) במודל Gemini Nano v3 המקומי. פיתוח זה מאפשר להאיץ את מהירות הרצת המודלים על גבי המכשיר ביותר מ-50% ללא צורך במודל טיוטה חיצוני המכביד על הזיכרון. הארכיטקטורה החדשה, המכונה Zero-copy, עושה שימוש ישיר ב-KV cache של מודל הבסיס הקיים, ובכך חוסכת כ-130MB מזיכרון ה-RAM הדינמי ומפחיתה את צריכת האנרגיה של הסוללה, תוך שמירה על רמת דיוק ובטיחות גבוהה במשימות עיבוד שפה וסיכומי מידע.

קרא עוד
ספקולטיב דיקודינג עם Hidden State: איך להאיץ LLM פי 3.3
מחקר
6 דקות
מ־arXiv cs.AI

ספקולטיב דיקודינג עם Hidden State: איך להאיץ LLM פי 3.3

**ספקולטיב דיקודינג עם Hidden State הוא גישה שממחזרת חישוב שנכשל במקום לזרוק אותו, ובכך עשויה להאיץ מודלי שפה גדולים עד פי 3.3 לפי מאמר חדש ב-arXiv.** עבור עסקים ישראליים, המשמעות אינה רק טכנית: אם מנועי inference יהפכו יעילים יותר, אפשר יהיה לקצר זמני תגובה ב-WhatsApp, להפעיל יותר שיחות על אותה תשתית, ולחבר AI בצורה כלכלית יותר ל-Zoho CRM ול-N8N. חשוב לזכור שמדובר כרגע במחקר ולא במוצר מסחרי זמין, אבל הכיוון ברור: התחרות ב-AI תעבור יותר ויותר דרך עלות וזמן תגובה, לא רק דרך איכות המודל.

קרא עוד