חיפוש בחדשות

7 תוצאות עבור "הקשר ארוך".

דחיסת הקשר ארוך ל-LLM: מה Latent Context Compilation משנה
מחקר
6 דקות
מ־arXiv cs.AI

דחיסת הקשר ארוך ל-LLM: מה Latent Context Compilation משנה

**Latent Context Compilation הוא מנגנון לדחיסת הקשר ארוך במודלי שפה לזיכרון נייד וקצר, בלי לשנות את המודל עצמו.** לפי המאמר, השיטה הראתה על Llama-3.1-8B שמירה על פרטים ויכולות הסקה גם בדחיסה של פי 16. עבור עסקים בישראל, המשמעות היא פוטנציאל להפעיל סוכנים מבוססי בינה מלאכותית עם פחות טוקנים, עלויות נמוכות יותר ופריסה פשוטה יותר בסביבה מרובת משתמשים. זה רלוונטי במיוחד למשרדי עורכי דין, סוכני ביטוח, מרפאות וחנויות אונליין שמנהלים היסטוריה ארוכה של מסמכים ושיחות. השאלה המעשית אינה רק איכות המודל, אלא איך לחבר זיכרון דחוס ל-WhatsApp, ל-CRM ול-N8N בלי לפגוע בפרטיות או במהירות התגובה.

קרא עוד
CHESS לניהול KV Cache: איך להאיץ מודלי שפה ארוכי־הקשר
מחקר
6 דקות
מ־arXiv cs.AI

CHESS לניהול KV Cache: איך להאיץ מודלי שפה ארוכי־הקשר

**CHESS היא שיטה לניהול KV cache במודלי שפה ארוכי־הקשר, שמטרתה לשפר מהירות אינפרנס בלי לפגוע באיכות.** לפי המאמר ב-arXiv, המערכת מגיעה לתוצאות חזקות גם עם 1% בלבד מה-cache ומציגה עד פי 4.56 תפוקה. עבור עסקים בישראל, המשמעות היא פוטנציאל להריץ סוכני שירות, ניתוח מסמכים ושיחות WhatsApp על הקשר ארוך יותר, בזמן תגובה נמוך יותר ובעלות תשתית סבירה יותר. זה חשוב במיוחד למשרדי עורכי דין, ביטוח, מרפאות ונדל"ן, שבהם כל תשובה נשענת על היסטוריה ארוכה של מסמכים, טפסים ושיחות.

קרא עוד
כימות PTQ ל-LLM חשיבתי על Ascend NPU: מה עובד ב-4bit ומה קורס
מחקר
6 דקות
מ־arXiv cs.AI

כימות PTQ ל-LLM חשיבתי על Ascend NPU: מה עובד ב-4bit ומה קורס

כימות PTQ (Post‑Training Quantization) הוא דרך לדחוס מודל שפה אחרי אימון ל-INT8/INT4 כדי להקטין זיכרון ולשפר ביצועים בפריסה. לפי arXiv:2602.17693v1 שבחן מודלי reasoning כמו DeepSeek-R1-Distill-Qwen (1.5B/7B/14B) ו-QwQ-32B על Ascend NPU, מתקבלת רגישות פלטפורמה מובהקת: INT8 נשאר יציב מספרית, בעוד שכימות 4bit אגרסיבי למשקולות+אקטיבציות עלול ליצור חוסר יציבות בכיול שכבות ולהוביל ל״קריסת לוגיקה״ בהקשר ארוך. לעסקים בישראל שמפעילים תהליכים מבוססי WhatsApp ו-CRM, ההמלצה הפרקטית היא להתחיל ב-INT8, לבנות סט בדיקות הקשר ארוך אמיתי מהדאטה שלכם, ורק אחר כך לשקול 4bit weight-only עם מדידת ביצועים מקצה לקצה (כולל overhead של dynamic quantization).

קרא עוד
זיכרון משותף לסוכני AI: Reload משיקה Epic
מוצר חדש
5 דקות
מ־TechCrunch

זיכרון משותף לסוכני AI: Reload משיקה Epic

**Epic של Reload מספק זיכרון משותף לסוכני AI, משמר הקשר ארוך טווח בפיתוח.** זה פותר בעיית אובדן מידע בצוותים מרובי סוכנים. לעסקים ישראלים, זה אומר אוטומציה עקבית יותר בוואטסאפ ו-CRM, חיסכון של 20 שעות שבועיות.

קרא עוד