MAGAZINE & UPDATES

חדשות AI ואוטומציה

המקור המוביל בישראל לעדכונים טכנולוגיים, ניתוחי עומק על בינה מלאכותית, ומדריכים לייעול העסק בעזרת אוטומציה.

LIVE
OpenAI חושפת מסגרת דיווח על אי-יישור ומציגה שישה מקרים חריגים
אוסף מיומנויות סוכן פתוח מבית AWS לשיפור הסקת מסקנות בבריאות
אופטימיזציית עלויות וזמני תגובה עם Prompt Caching ב-Bedrock
עקרונות לעיצוב בינה מלאכותית קולית ומסגרת איכות השיחה
סוכני בינה מלאכותית בעלי אופק ארוך ומודל התפעול המשפטי של Supio
רכישת Arize AI בידי Dynatrace: מעבר מזיהוי לפעולה תפעולית
תזמור תהליכים: מודלי ביצוע, אתגרי ייצור ותזמור מול כוריאוגרפיה
Amazon Quick זמין כעת באופן כללי למחשב השולחני
הרחבת השימוש בסוכני פיתוח ב-Salesforce ל-15,000 מהנדסים
סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח
מילון מונחי AI מקיף: המושגים המרכזיים שצריך להכיר
סיסקו מעצבת מחדש את מחשוב הקצה עבור עומסי בינה מלאכותית
אבטחת תהליכי עבודה: בקרות לענפים מוסדרים לפי n8n
אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow
שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון
OpenAI חושפת מסגרת דיווח על אי-יישור ומציגה שישה מקרים חריגים
אוסף מיומנויות סוכן פתוח מבית AWS לשיפור הסקת מסקנות בבריאות
אופטימיזציית עלויות וזמני תגובה עם Prompt Caching ב-Bedrock
עקרונות לעיצוב בינה מלאכותית קולית ומסגרת איכות השיחה
סוכני בינה מלאכותית בעלי אופק ארוך ומודל התפעול המשפטי של Supio
רכישת Arize AI בידי Dynatrace: מעבר מזיהוי לפעולה תפעולית
תזמור תהליכים: מודלי ביצוע, אתגרי ייצור ותזמור מול כוריאוגרפיה
Amazon Quick זמין כעת באופן כללי למחשב השולחני
הרחבת השימוש בסוכני פיתוח ב-Salesforce ל-15,000 מהנדסים
סיילספורס מציגה את סוכן התזמון של Agentforce לשירות שטח
מילון מונחי AI מקיף: המושגים המרכזיים שצריך להכיר
סיסקו מעצבת מחדש את מחשוב הקצה עבור עומסי בינה מלאכותית
אבטחת תהליכי עבודה: בקרות לענפים מוסדרים לפי n8n
אקספריאן מתרחבת לתחום סוכני ה-AI בשותפות עם ServiceNow
שלושה סימנים לכך שסוכן AI יחיד אינו מספיק בארגון

חדשות AI - עמוד 80

עמוד 80 מתוך 196
תגמול היררכי מספה טבעית: כך מיישרים סוכני AI לעסק
מחקר
6 דקות
מ־arXiv cs.AI

תגמול היררכי מספה טבעית: כך מיישרים סוכני AI לעסק

**תגמול היררכי מספה טבעית הוא דרך להגדיר לסוכן AI לא רק מה להשיג, אלא גם איך לפעול בכל שלב.** מחקר חדש ב-arXiv מציג את HRDL ואת L2HR, שתי מסגרות שמטרתן לשפר התאמה של סוכנים להנחיות אנושיות במשימות ארוכות טווח. מבחינת עסקים בישראל, המשמעות ברורה: אם סוכן מטפל בלידים, קובע פגישות או מעדכן CRM, חייבים למדוד גם עמידה במדיניות, לא רק תוצאה. השילוב בין WhatsApp Business API, ‏Zoho CRM, ‏N8N וסוכני AI מאפשר ליישם את הרעיון הזה בפועל — עם כללי פעולה, נקודות בקרה והעברה לנציג אנושי בעת חריגה. זהו כיוון חשוב במיוחד לענפים כמו ביטוח, רפואה, נדל"ן ומשפט.

קרא עוד
מהי סמנטיקה סיבתית בסוכני AI: למה מודלים חייבים מבנה סמלי
מחקר
6 דקות
מ־arXiv cs.AI

מהי סמנטיקה סיבתית בסוכני AI: למה מודלים חייבים מבנה סמלי

**סמנטיקה סיבתית בסוכני AI היא הרעיון שמערכת בינה מלאכותית צריכה לייצג עולם בצורה סיבתית, דחוסה וסמלית — לא רק כקרבה בין embeddings.** מחקר חדש ב-arXiv טוען שמגבלות פיזיקליות של זיכרון, חישוב ואנרגיה דוחפות מערכות חכמות למבנים בדידים ולוגיים. עבור עסקים בישראל, המשמעות מעשית מאוד: צ’אטבוט או סוכן WhatsApp שלא מחובר לסטטוסים, כללים ו-CRM יתקשה לנהל תהליך אמיתי. לכן, ביישומים כמו שירות לקוחות, ניהול לידים ותיאום תורים, כדאי לבנות שכבה היברידית שמשלבת מודל שפה עם WhatsApp Business API, ‏Zoho CRM ו-N8N.

קרא עוד
זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף
מחקר
6 דקות
מ־arXiv cs.AI

זיהוי הלוצינציות ב-LLM עם Spilled Energy ללא אימון נוסף

**Spilled Energy הוא מדד חדש לזיהוי הלוצינציות במודלי שפה גדולים, המבוסס על logits בזמן יצירה ואינו דורש אימון נוסף.** לפי מחקר חדש ב-arXiv, המדד נבדק על 9 בנצ'מרקים ובמודלים כמו LLaMA, Mistral, Gemma ו-Qwen3, והראה יכולת תחרותית בזיהוי שגיאות עובדתיות והטיות. עבור עסקים בישראל, המשמעות היא אפשרות לבנות שכבת בקרה מעל עוזרי AI, מערכות WhatsApp ו-CRM, כך שתשובות בסיכון גבוה לא יישלחו אוטומטית. זה רלוונטי במיוחד למשרדי עורכי דין, מרפאות, ביטוח וחנויות אונליין שמחברים AI Agents, Zoho CRM, WhatsApp Business API ו-N8N לתהליכי שירות ומכירה.

קרא עוד
איסור Anthropic בממשל ארה"ב: מה זה אומר לעסקים בישראל
ניתוח
6 דקות
מ־Wired

איסור Anthropic בממשל ארה"ב: מה זה אומר לעסקים בישראל

**איסור השימוש ב-Anthropic בממשל ארה"ב הוא סימן אזהרה לכל עסק שבונה תהליכים על ספק AI יחיד.** לפי הדיווח ב-WIRED, טראמפ הורה לסוכנויות פדרליות להפסיק שימוש בכלי החברה עם תקופת מעבר של 6 חודשים, לאחר עימות סביב שימושים צבאיים מותרים. עבור עסקים בישראל, הלקח המרכזי הוא צורך במבנה רב-מודלי: לא לחבר שירות, מכירות או CRM למודל שפה אחד בלי חלופה. ארגון שמחבר בין WhatsApp Business API, ‏Zoho CRM ו-N8N יכול לייצר רציפות תפעולית, בקרה על מידע רגיש, והחלפת ספק מהירה אם מדיניות שימוש משתנה.

קרא עוד
Nano Banana 2 של גוגל: עריכת תמונות מהירה עם סיכון אמיתי
ניתוח
6 דקות
מ־Wired

Nano Banana 2 של גוגל: עריכת תמונות מהירה עם סיכון אמיתי

**Nano Banana 2 הוא מחולל וערוך תמונות חדש של Google בתוך Gemini, שמייצר תמונות מהר יותר ומקל על שינוי צילומים קיימים - אבל גם מגדיל את הסיכון למידע חזותי מטעה.** לפי הדיווח ב-WIRED, הכלי חינמי, נגיש מאוד, ויכול לשלב טקסט ומידע מהרשת בתוך תמונה. בפועל, בניסוי אחד הוא אף משך נתוני מזג אוויר שגויים. עבור עסקים בישראל, המשמעות היא כפולה: אפשר לייצר תוכן שיווקי מהיר יותר, אך חייבים להוסיף בקרת נתונים, אישור אנושי ותיעוד במערכות כמו Zoho CRM ו-N8N לפני פרסום ב-WhatsApp או ברשתות חברתיות.

קרא עוד
התרחבות OpenAI בלונדון: מה זה אומר על שוק גיוס ה-AI
ניתוח
6 דקות
מ־Wired

התרחבות OpenAI בלונדון: מה זה אומר על שוק גיוס ה-AI

**התרחבות OpenAI בלונדון היא מהלך אסטרטגי שמאותת על השלב הבא בשוק ה-AI: פחות מרדף אחרי כותרות, יותר השקעה באמינות, בטיחות והערכת ביצועים.** לפי WIRED, OpenAI תהפוך את לונדון למרכז המחקר הגדול ביותר שלה מחוץ לארה״ב ותתחרה ישירות ב-Google DeepMind על חוקרים מאוניברסיטאות כמו Oxford ו-Cambridge. עבור עסקים בישראל, המשמעות היא שכלי AI שמתחברים ל-WhatsApp Business API, ל-Zoho CRM ול-N8N עשויים להפוך יציבים ושימושיים יותר. אבל זה גם אומר שעליכם לבחור מערכות עם API, לנהל נכון פרטיות ונתונים, ולהתחיל בפיילוט ממוקד עם מדדי הצלחה ברורים.

קרא עוד
ממשקי AI חדשים ב-OpenAI: למה הגיוס של ריילי וולז חשוב
ניתוח
6 דקות
מ־Wired

ממשקי AI חדשים ב-OpenAI: למה הגיוס של ריילי וולז חשוב

**ממשקי AI חדשים הם הגורם שקובע אם בינה מלאכותית תהפוך לכלי עבודה אמיתי או תישאר רק הדגמה מרשימה.** הגיוס של ריילי וולז ל-OpenAI, לצוות OAI Labs שמפתח דרכי אינטראקציה חדשות עם AI, מסמן שהמרוץ עובר ממודלים לממשקים. לפי WIRED, המהלך מגיע כש-ChatGPT כבר משרת יותר מ-800 מיליון משתמשים בשבוע. עבור עסקים בישראל, המשמעות ברורה: הערך לא נמצא רק במודל, אלא בחיבור שלו ל-WhatsApp, ל-CRM ולתהליכים יומיומיים. מי שיבנה חוויה פשוטה, מחוברת ומדידה עם כלים כמו Zoho CRM, N8N ו-WhatsApp Business API, ייהנה מזמן תגובה קצר יותר ומאימוץ טוב יותר של AI בארגון.

קרא עוד
TierMem לזיכרון מדורג לסוכנים ארוכי טווח: פחות טוקנים, כמעט בלי לוותר על דיוק
מחקר
6 דקות
מ־arXiv cs.AI

TierMem לזיכרון מדורג לסוכנים ארוכי טווח: פחות טוקנים, כמעט בלי לוותר על דיוק

**TierMem הוא מנגנון זיכרון דו-שכבתי לסוכנים ארוכי טווח שמחליט בזמן המענה אם מספיק להסתמך על סיכום מהיר או שצריך להסלים ללוגים גולמיים כדי להביא ראיות מאומתות. לפי המאמר (arXiv:2602.17913v1), ב-LoCoMo השיטה הגיעה לדיוק 0.851 לעומת 0.873 ב-raw-only, תוך חיסכון של 54.1% בטוקנים ו-60.7% בהשהיה.** עבור עסקים בישראל שמפעילים שיחה רציפה ב-WhatsApp Business API ומנהלים לקוחות ב-Zoho CRM, המשמעות היא ניהול סיכונים: סיכומים לבד עלולים להשמיט “תנאי קריטי” (מחיר, הסכמה, רגישות רפואית), ולכן כדאי לבנות דרך N8N שכבת לוגים בלתי ניתנים לשינוי וכללי הסלמה לשאילתות רגישות. כך מצמצמים עלות ותורמים לעקיבות פנימית.

קרא עוד
NL2LOGIC לתרגום משפטים ללוגיקה מסדר ראשון: 99% תחביר, +30% משמעות
מחקר
6 דקות
מ־arXiv cs.AI

NL2LOGIC לתרגום משפטים ללוגיקה מסדר ראשון: 99% תחביר, +30% משמעות

**NL2LOGIC היא מסגרת שמתרגמת טקסט לשפה טבעית ללוגיקה מסדר ראשון (FOL) דרך עץ תחביר מופשט (AST), כך שהפלט עומד בכללי דקדוק וניתן להרצה בסולברים. לפי המאמר, היא מגיעה ל‑99% דיוק תחבירי ומשפרת נכונות סמנטית עד 30% בבנצ’מרקים כמו FOLIO ו‑ProofWriter.** לעסקים בישראל זה חשוב במיוחד בתהליכים שבהם “צריך להכריע” ולא רק “לנסח”: החזרים, חריגי שירות, תנאי חוזה, ניגוד עניינים במשרדי עורכי דין או סיווג פניות בביטוח ונדל"ן. שילוב עם WhatsApp Business API, N8N ו‑Zoho CRM מאפשר לקלוט פנייה, להפעיל כללים פורמליים, להחזיר החלטה מוסברת, ולתעד אותה ב‑CRM לצורכי בקרה וציות (כולל עקרונות חוק הגנת הפרטיות).

קרא עוד
Lang2Act ל-VRAG: שרשראות כלים לשוניות שמחדדות תפיסה חזותית ב‑VLM
מחקר
6 דקות
מ־arXiv cs.AI

Lang2Act ל-VRAG: שרשראות כלים לשוניות שמחדדות תפיסה חזותית ב‑VLM

**Lang2Act הוא מנגנון VRAG שבו מודל ראייה-שפה (VLM) מייצר בעצמו “פעולות” כשרשראות לשוניות, ואז משתמש בהן ככלים כדי לשפר תפיסה חזותית והסקה. לפי המאמר arXiv:2602.13235v1, הגישה מצמצמת איבוד מידע שנוצר בזרימות עבודה שמפרידות בין תפיסה להיגיון (למשל אחרי crop), ומשיגה שיפור של יותר מ‑4% בתוצאות הניסויים.** לעסקים בישראל זה רלוונטי במיוחד בתהליכים שמבוססים על תמונות ב-WhatsApp: צילומי מסך של תקלות, מסמכים, ותמונות מוצר. במקום להסתמך על כלי חיתוך/OCR קשיחים שמאבדים הקשר, כדאי לבנות פיילוט שבו כל שלבי התפיסה מתועדים, מחוברים ל-Zoho CRM, ומופעלים דרך N8N — עם מדיניות פרטיות ברורה (למשל שמירת תמונות ל-30 יום).

קרא עוד
מענה לשאלות רפואיות תלוי-מצב: CondMedQA מציב רף חדש לדיוק קליני
מחקר
6 דקות
מ־arXiv cs.AI

מענה לשאלות רפואיות תלוי-מצב: CondMedQA מציב רף חדש לדיוק קליני

מענה לשאלות רפואיות תלוי-מצב הוא מצב שבו אותה שאלה מקבלת תשובה שונה לפי תנאי המטופל—קומורבידיות, אלרגיות או התוויות-נגד. במאמר arXiv:2602.17911v1 מוצגים CondMedQA (בנצ׳מרק חדש שמודד היסק מותנה) ו-Condition-Gated Reasoning (CGR), שמפעיל/גוזם מסלולי היסק בגרף ידע לפי תנאי השאלה כדי לבחור תשובה ישימה יותר. לעסקים בישראל שמפתחים כלי טריאז׳, טלה-רפואה או שירות במוקדי אחיות, המשמעות היא שינוי מדידה: לא “דיוק ממוצע”, אלא דיוק במקרי קצה. פרקטית, אפשר לשלב איסוף תנאים ב-WhatsApp Business API, לשמור שדות ב-Zoho CRM, ולהפעיל ב-N8N “שער תנאים” שמנתב מקרים מסוכנים לגורם אנושי ומייצר לוגים לאודיט.

קרא עוד
חוסם הסחות דעת מבוסס צילומי מסך ב‑macOS: מה המשמעות של Fomi לעסקים
ניתוח
6 דקות
מ־Wired

חוסם הסחות דעת מבוסס צילומי מסך ב‑macOS: מה המשמעות של Fomi לעסקים

**Fomi הוא חוסם הסחות דעת ל‑macOS שמצלם את החלון הפעיל ושולח תמונה מעובדת למודל ענני כדי לזהות אם אתם עובדים או מתפזרים. לפי WIRED, יש ניסיון של 3 ימים ואז מחיר של 8 דולר לחודש, ובבדיקה אחת הועלו כ‑0.5GB צילומי מסך ביום—מה שמחדד את סוגיית הפרטיות.** לעסקים בישראל זה רלוונטי בעיקר לצוותי שיווק/תוכן, אבל בתפקידים עם מידע רגיש (משפטים, בריאות, ביטוח) צילום מסך לענן עלול להיות סיכון. לפני שמאמצים כלי כזה, כדאי למדוד תוצאות (זמן כתיבת הצעת מחיר, כמות משימות שנסגרות) ולשקול חלופה תהליכית: חיבור WhatsApp Business API ל‑Zoho CRM דרך N8N כדי להפחית קפיצות בין מערכות.

קרא עוד
PlotChain לקריאת גרפים הנדסיים: בנצ'מרק דטרמיניסטי שמבדיל בין MLLM טוב למצוין
ניתוח
6 דקות
מ־arXiv cs.AI

PlotChain לקריאת גרפים הנדסיים: בנצ'מרק דטרמיניסטי שמבדיל בין MLLM טוב למצוין

PlotChain הוא בנצ'מרק דטרמיניסטי שמודד עד כמה מודלים מולטימודליים (MLLMs) מצליחים לקרוא גרפים הנדסיים ולהחזיר ערכים מספריים מדויקים ב-JSON, במקום להסתפק ב-OCR או תיאור חופשי. לפי ה-preprint (arXiv:2602.13232v1), המאגר כולל 15 משפחות ו-450 גרפים עם אמת מידה שמחושבת ישירות מתהליך היצירה, ובנוסף “נקודות בדיקה” (cp_) שמאפשרות לאתר איפה המודל נכשל. התוצאות מדגישות פערים: Gemini 2.5 Pro מגיע ל-80.42% pass-rate בשדות, GPT‑4.1 ל-79.84% ו-Claude Sonnet 4.5 ל-78.21%, בעוד GPT‑4o ב-61.59%. המשימות השבריריות ביותר הן בתחום התדר: bandpass עד 23% ו-FFT מאתגר. לעסקים בישראל שמקבלים דוחות כ-PDF ב-WhatsApp, זו תזכורת לבנות פיילוט עם טולרנסים, QA וזרימה מחוברת ל-N8N ו-Zoho CRM.

קרא עוד
Dual-Cycle ל-Agentי משחק תפקידים: נאמנות לדמות בלי להיפרץ
מחקר
6 דקות
מ־arXiv cs.AI

Dual-Cycle ל-Agentי משחק תפקידים: נאמנות לדמות בלי להיפרץ

**Dual-Cycle Adversarial Self-Evolution הוא מנגנון הגנה ללא אימון לסוכני משחק תפקידים ב-LLM: מחזור “תוקף” מייצר פרומפטים חזקים יותר ל-jailbreak, ומחזור “מגן” מזקק את הכשלים לבסיס ידע היררכי (כללי בטיחות, אילוצי פרסונה, ודוגמאות בטוחות).** לפי תקציר arXiv:2602.13234v1, בזמן ריצה המערכת שולפת ומרכיבה את הידע כדי לשמור גם על נאמנות לדמות וגם על בטיחות, ואף מדווחת על שיפור עקבי לעומת baseline-ים במודלים קנייניים. לעסקים בישראל שמפעילים שיחה עם לקוחות ב-WhatsApp, המשמעות פרקטית: במקום להסתמך רק על פרומפט מערכת, כדאי לנהל מדיניות ותשובות מאושרות בתוך CRM (כמו Zoho CRM) ולשלוף אותן בזמן אמת דרך N8N—כדי לצמצם סיכוני התחייבויות, מידע שגוי או הפרת פרטיות.

קרא עוד
Trajectory-Dominant Pareto Optimization: למה מודלי AI נתקעים בלונג-טרם
מחקר
6 דקות
מ־arXiv cs.AI

Trajectory-Dominant Pareto Optimization: למה מודלי AI נתקעים בלונג-טרם

**Trajectory-Dominant Pareto Optimization הוא רעיון שמגדיר אינטליגנציה כ“מסלול התפתחות” לאורך זמן ולא כתוצאה נקודתית.** לפי מחקר חדש ב-arXiv (2602.13230v1), מערכות AI יכולות להיתקע ב“מלכודות פארטו” — אזורים שנראים טובים מקומית (לא נשלטים במדדים), אך חוסמים גישה למסלולים גלובליים טובים יותר. החוקרים מציעים מדד בשם TEDI שמעריך כמה קשה לברוח מהמלכודת בגלל מרחק שינוי, אילוצים מבניים ואינרציה. לעסקים בישראל זה אומר שלא תמיד צריך עוד דאטה או מודל גדול יותר; לפעמים צריך לשנות מדדי הצלחה ותהליך. אם אתם מפעילים WhatsApp Business API עם Zoho CRM ואוטומציות ב-N8N, כדאי לבנות פיילוט 14 יום של שני מסלולי שיחה, למדוד השפעה על סגירה/נטישה, ולהגדיר “מינימום נסבל” לכל KPI כדי לאפשר שינוי מסלול.

קרא עוד
Soft labels למידול נושאים: שיפור Neural Topic Modeling עם פיקוח ממודלי שפה
מחקר
6 דקות
מ־arXiv cs.AI

Soft labels למידול נושאים: שיפור Neural Topic Modeling עם פיקוח ממודלי שפה

**Soft label distributions למידול נושאים הן תוויות הסתברותיות שמחליפות שחזור Bag‑of‑Words דל-קונטקסט באות פיקוח סמנטי שמגיע ממודל שפה. לפי arXiv:2602.17907v1, החוקרים מייצרים תוויות רכות מהסתברויות הטוקן הבא תחת פרומפט ייעודי ומקרינים אותן על אוצר מילים מוגדר, ואז מאמנים את מודל הנושאים לשחזר אותן—מה ששיפר קוהרנטיות ופיוּריות בשלושה דאטהסטים.** לעסקים בישראל המשמעות היא סיווג טוב יותר של טקסטים קצרים ורועשים (בעיקר WhatsApp), ושדרוג יכולות חיפוש פנימי: מציאת פניות “דומות” גם כשהניסוח משתנה. פיילוט נכון מתחיל בהגדרת אוצר מילים, ניקוי מידע אישי לפי חוק הגנת הפרטיות, וחיבור התוצאות ל‑Zoho CRM דרך N8N כדי למדוד SLA וזמן טיפול.

קרא עוד
יכולות ידע חזותי עדין ב‑VLM: למה מודלי ראייה-שפה נכשלים בסיווג?
ניתוח
6 דקות
מ־arXiv cs.AI

יכולות ידע חזותי עדין ב‑VLM: למה מודלי ראייה-שפה נכשלים בסיווג?

מודלי ראייה‑שפה (VLM) מצטיינים ב‑VQA ובדיאלוג רב‑מודאלי, אבל זה לא אומר שהם טובים בסיווג תמונות “עדין” (fine‑grained) ברמת דגם/תת‑סוג. לפי arXiv:2602.17871, שדרוג מודל השפה (LLM) משפר מדדים באופן דומה בכל הבנצ’מרקים, בעוד ששדרוג מקודד הראייה (vision encoder) משפר בצורה בולטת דווקא את הסיווג העדין. עבור עסקים בישראל זה קריטי ביוזקייסים כמו זיהוי מוצר מתמונה ב‑WhatsApp, סיווג חלקי חילוף, או תיוג מסמכים מצולמים ל‑Zoho CRM. ההמלצה: להגדיר סט בדיקה פנימי, להריץ A/B בין מקודדי ראייה, ולבנות מסלול “אי‑ודאות” שמחזיר מקרים קשים לנציג תוך איסוף דאטה לשיפור—מנוהל ב‑N8N ומחובר ל‑WhatsApp Business API ו‑CRM.

קרא עוד
טקסונומיה גאומטרית להזיות ב-LLM: למה גלאים נכשלים בין תחומים
מחקר
5 דקות
מ־arXiv cs.AI

טקסונומיה גאומטרית להזיות ב-LLM: למה גלאים נכשלים בין תחומים

"הזיות" במודלי שפה גדולים אינן קטגוריה אחת: מחקר arXiv:2602.13224v1 מציע טקסונומיה גאומטרית של שלושה סוגים—אי-נאמנות להקשר, קונפבולציה (המצאת תוכן זר), ושגיאה עובדתית. הנתון שמזיז את הגבינה: גלאי אמבדינג מגיעים ל-AUROC 0.76–0.99 בתוך תחום, אבל נופלים ל-0.50 בין תחומים, והכיוונים המבדילים כמעט אורתוגונליים (דמיון קוסיני ממוצע ‎-0.07). לעומת זאת, בקונפבולציות שנכתבו על ידי בני אדם יש “כיוון גלובלי” עם AUROC ‎0.96. המסקנה לעסקים בישראל, במיוחד בצ’אט שירות/מכירות ב-WhatsApp: אמבדינג יכול לעצור סטייה מהקשר, אבל טעויות עובדתיות (AUROC ‎0.478) דורשות אימות מול Zoho CRM/ERP דרך N8N ובקרת אדם-בלולאה.

קרא עוד