חיפוש בחדשות

2 תוצאות עבור "H100".

TurboQuant לדחיסת KV Cache: מהפכת ביצועים למודלי AI
ניתוח
6 דקות
מ־Google Research

TurboQuant לדחיסת KV Cache: מהפכת ביצועים למודלי AI

**TurboQuant הוא אלגוריתם דחיסה חדש של Google Research שמקטין את זיכרון ה-KV cache ואת עלות החיפוש הווקטורי בלי לפגוע בדיוק, ולפי הדיווח משיג לפחות פי 6 חיסכון בזיכרון ועד פי 8 שיפור ביצועים על H100.** מבחינת עסקים בישראל, המשמעות היא פוטנציאל ממשי להוזלת מערכות AI שמטפלות במסמכים, צ'אט ושירות לקוחות. הערך הגדול אינו רק טכני: דחיסה טובה יותר יכולה לאפשר תגובות מהירות יותר ב-WhatsApp, שליפה חכמה ממסמכים ב-Zoho CRM, ופחות עומס תשתיתי במערכות מבוססות N8N וחיפוש סמנטי. ההמלצה המעשית היא להתחיל בפיילוט ממוקד, למדוד latency, עלות לפנייה ואיכות תשובה, ורק אז להרחיב.

קרא עוד
אופטימיזציית קרנלי GPU עם K-Search: מהפכת הביצועים
מחקר
6 דקות
מ־arXiv cs.AI

אופטימיזציית קרנלי GPU עם K-Search: מהפכת הביצועים

**K-Search הוא מחקר שמציע דרך חדשה לאופטימיזציית קרנלי GPU באמצעות שילוב של תכנון מפורש ויצירת קוד, ולא רק ניסוי וטעייה של מודל שפה.** לפי המאמר, השיטה השיגה שיפור ממוצע של 2.10x ועד 14.3x בקרנלי MoE, ואף הגיעה ל-1030 מיקרו-שניות במשימת TriMul על NVIDIA H100. עבור עסקים בישראל, המשמעות אינה פיתוח CUDA פנימי אלא הפחתת עלויות inference, שיפור זמני תגובה, והבנה שתשתיות AI משפיעות ישירות על שירות, מכירות ורווחיות. מי שמחבר AI Agents, WhatsApp Business API, Zoho CRM ו-N8N צריך לעקוב לא רק אחרי המודל, אלא גם אחרי הביצועים של שכבת ההרצה.

קרא עוד