חיפוש בחדשות

9 תוצאות עבור "OCR".

סוכני AI מול פקסים רפואיים: כיצד נעלמים תורי ההמתנה לרופאים מומחים
חדשות
5 דקות
מ־TechCrunch

סוכני AI מול פקסים רפואיים: כיצד נעלמים תורי ההמתנה לרופאים מומחים

מרפאות מומחים קורסות תחת נטל מנהלתי המעכב קביעת תורים למטופלים. סטארט-אפים חדשים בתחום הבריאות מתמודדים עם הבעיה באמצעות סוכני AI המשלבים קריאת מסמכים אוטומטית (OCR מתקדם) וסוכנים קוליים. חברת Basata, אשר הוקמה על ידי יוצאי מערכות בריאות ורכב אוטונומי, מגייסה 21 מיליון דולר כדי ליישם פתרון שבו בינה מלאכותית מפענחת הפניות רפואיות שמתקבלות בפקס, ומתקשרת עצמאית למטופלים תוך דקות לקביעת תור. עם 100,000 מטופלים שטופלו בחודש האחרון בלבד ותחרות גוברת מצד סטארט-אפים בהערכות שווי של מאות מיליוני דולרים, ניכר כי האוטומציה האדמיניסטרטיבית הופכת לתשתית קריטית למניעת נטישת לקוחות בקליניקות פרטיות ובמרכזים רפואיים בישראל ובעולם.

קרא עוד
Phi-4-reasoning-vision-15B: מודל חזון-שפה קטן לעסקים
ניתוח
6 דקות
מ־Microsoft Research

Phi-4-reasoning-vision-15B: מודל חזון-שפה קטן לעסקים

**Phi-4-reasoning-vision-15B הוא מודל חזון-שפה פתוח בגודל 15B שמכוון לאיזון בין דיוק, מהירות ועלות חישוב.** לפי מיקרוסופט, הוא אומן על 200 מיליארד טוקנים בלבד ועדיין מציג ביצועים תחרותיים במשימות כמו קריאת מסמכים, ניתוח מסכים, OCR, מתמטיקה ומדע. מבחינת עסקים בישראל, הערך האמיתי הוא היכולת לשלב מודל כזה בתהליכים כמו קליטת מסמכים ב-WhatsApp, חילוץ נתונים, עדכון Zoho CRM ובקרת זרימה דרך N8N. ההמלצה הפרקטית: לא לרדוף רק אחרי המודל הגדול ביותר, אלא לבדוק בפיילוט מדדי דיוק, latency ועלות לכל מסמך או מסך אמיתי מתוך תהליך עסקי.

קרא עוד
Lang2Act ל-VRAG: שרשראות כלים לשוניות שמחדדות תפיסה חזותית ב‑VLM
מחקר
6 דקות
מ־arXiv cs.AI

Lang2Act ל-VRAG: שרשראות כלים לשוניות שמחדדות תפיסה חזותית ב‑VLM

**Lang2Act הוא מנגנון VRAG שבו מודל ראייה-שפה (VLM) מייצר בעצמו “פעולות” כשרשראות לשוניות, ואז משתמש בהן ככלים כדי לשפר תפיסה חזותית והסקה. לפי המאמר arXiv:2602.13235v1, הגישה מצמצמת איבוד מידע שנוצר בזרימות עבודה שמפרידות בין תפיסה להיגיון (למשל אחרי crop), ומשיגה שיפור של יותר מ‑4% בתוצאות הניסויים.** לעסקים בישראל זה רלוונטי במיוחד בתהליכים שמבוססים על תמונות ב-WhatsApp: צילומי מסך של תקלות, מסמכים, ותמונות מוצר. במקום להסתמך על כלי חיתוך/OCR קשיחים שמאבדים הקשר, כדאי לבנות פיילוט שבו כל שלבי התפיסה מתועדים, מחוברים ל-Zoho CRM, ומופעלים דרך N8N — עם מדיניות פרטיות ברורה (למשל שמירת תמונות ל-30 יום).

קרא עוד
PlotChain לקריאת גרפים הנדסיים: בנצ'מרק דטרמיניסטי שמבדיל בין MLLM טוב למצוין
ניתוח
6 דקות
מ־arXiv cs.AI

PlotChain לקריאת גרפים הנדסיים: בנצ'מרק דטרמיניסטי שמבדיל בין MLLM טוב למצוין

PlotChain הוא בנצ'מרק דטרמיניסטי שמודד עד כמה מודלים מולטימודליים (MLLMs) מצליחים לקרוא גרפים הנדסיים ולהחזיר ערכים מספריים מדויקים ב-JSON, במקום להסתפק ב-OCR או תיאור חופשי. לפי ה-preprint (arXiv:2602.13232v1), המאגר כולל 15 משפחות ו-450 גרפים עם אמת מידה שמחושבת ישירות מתהליך היצירה, ובנוסף “נקודות בדיקה” (cp_) שמאפשרות לאתר איפה המודל נכשל. התוצאות מדגישות פערים: Gemini 2.5 Pro מגיע ל-80.42% pass-rate בשדות, GPT‑4.1 ל-79.84% ו-Claude Sonnet 4.5 ל-78.21%, בעוד GPT‑4o ב-61.59%. המשימות השבריריות ביותר הן בתחום התדר: bandpass עד 23% ו-FFT מאתגר. לעסקים בישראל שמקבלים דוחות כ-PDF ב-WhatsApp, זו תזכורת לבנות פיילוט עם טולרנסים, QA וזרימה מחוברת ל-N8N ו-Zoho CRM.

קרא עוד
Trifuse: שיפור מיקוד GUI ללא אימון יקר
מחקר
4 דקות
מ־arXiv cs.AI

Trifuse: שיפור מיקוד GUI ללא אימון יקר

Trifuse משפרת מיקוד אלמנטים בממשקי GUI ללא אימון ספציפי, באמצעות שילוב תשומת לב, OCR וכיתובי אייקונים. ביצועים גבוהים על בנצ'מרקים מוכיחים חיסכון בנתונים. גלו כיצד זה משפיע על אוטומציה עסקית.

קרא עוד