חיפוש בחדשות

11 תוצאות עבור "MCTS".

M-JudgeBench: איך מודדים אמינות של מודלי שופט מולטימודליים
מחקר
6 דקות
מ־arXiv cs.AI

M-JudgeBench: איך מודדים אמינות של מודלי שופט מולטימודליים

**מודל שופט מולטימודלי הוא מערכת בינה מלאכותית שבודקת ומדרגת תשובות של מודלים אחרים, והמחקר החדש M-JudgeBench מציע 10 ממדי בדיקה כדי למדוד אם אפשר לסמוך עליו.** לפי התקציר ב-arXiv, הבנצ'מרק החדש בוחן השוואת Chain-of-Thought, הימנעות מהטיית אורך וזיהוי שגיאות תהליך, ובמקביל מציג את Judge-MCTS ו-M-Judger לשיפור ביצועי השיפוט. עבור עסקים בישראל, המשמעות מעשית מאוד: אם אתם משתמשים ב-AI לניקוד לידים, בקרה על שיחות WhatsApp, או סקירת מסמכים, אסור להסתמך על ציון אוטומטי בלי שכבת בדיקה נוספת, API מסודר ודגימה אנושית.

קרא עוד
LiTS לחיפוש עץ ב-LLM: מה זה אומר לעסקים שבונים סוכני AI
מחקר
6 דקות
מ־arXiv cs.AI

LiTS לחיפוש עץ ב-LLM: מה זה אומר לעסקים שבונים סוכני AI

**LiTS הוא פריימוורק מודולרי לחיפוש עץ עבור מודלי שפה גדולים, שמפריד בין Policy, Transition ו-RewardModel כדי לשפר reasoning רב-שלבי.** לפי המאמר ב-arXiv, התרומה המשמעותית ביותר אינה רק התמיכה ב-MCTS ו-BFS, אלא הממצא שבמרחבי פעולה אינסופיים צוואר הבקבוק הוא גיוון ההצעות של המודל ולא איכות הניקוד. עבור עסקים בישראל, זו תובנה חשובה לבניית סוכני AI ב-WhatsApp, Zoho CRM ו-N8N: אם הסוכן בוחן רק מסלול אחד, גם מערכת דירוג טובה לא תספיק. המשמעות המעשית היא לעבור מאוטומציה ליניארית למנוע החלטות שבודק כמה חלופות, מודד תוצאות ומנהל תהליך רב-שלבי בצורה מבוקרת.

קרא עוד
מחקר AI4S-SDS: כך AI מתכנן פורמולציות כימיות חדשות
מחקר
6 דקות
מ־arXiv cs.AI

מחקר AI4S-SDS: כך AI מתכנן פורמולציות כימיות חדשות

AI4S-SDS היא מסגרת נוירו-סימבולית שמחברת בין סוכני AI, חיפוש עץ מסוג MCTS ומנוע פיזיקלי דיפרנציאלי כדי לתכנן פורמולציות כימיות תחת אילוצים מורכבים. לפי המאמר ב-arXiv, המערכת השיגה תוקף מלא תחת אילוצי HSP ושיפרה את מגוון החיפוש לעומת סוכני LLM בסיסיים. עבור עסקים בישראל, הערך המרכזי אינו דווקא בכימיה אלא בארכיטקטורה: זיכרון חיצוני, חיפוש בין כמה מסלולים, ואימות החלטות מול חוקים ונתונים. זהו כיוון חשוב לכל ארגון שמחבר AI Agents עם WhatsApp Business API, Zoho CRM ו-N8N לצורך קבלת החלטות מורכבת.

קרא עוד
RF-Agent לתכנון פונקציות תגמול בבקרת רובוטיקה
מחקר
6 דקות
מ־arXiv cs.AI

RF-Agent לתכנון פונקציות תגמול בבקרת רובוטיקה

**RF-Agent הוא מסגרת מחקרית שמשתמשת במודלי שפה וב-Monte Carlo Tree Search כדי לתכנן פונקציות תגמול בצורה יעילה יותר.** לפי המאמר, השיטה נבחנה ב-17 משימות בקרה והציגה תוצאות טובות לעומת גישות קודמות, בעיקר בזכות שימוש חכם יותר במשוב היסטורי. עבור עסקים בישראל, הערך אינו ברובוטיקה עצמה אלא בתפיסה: AI עובד טוב יותר כשמגדירים לו מדדים, תהליך וחיפוש בין חלופות. זו גישה שרלוונטית גם ל-WhatsApp Business API, Zoho CRM ו-N8N, במיוחד בניהול לידים, שירות ותיאום פגישות. המסקנה המעשית: לפני שבוחרים מודל, הגדירו 3-4 KPI ברורים לפיילוט של שבועיים.

קרא עוד
M²-Miner: פריצת דרך בכריית נתונים לסוכני GUI ניידים
מחקר
2 דקות
מ־arXiv cs.AI

M²-Miner: פריצת דרך בכריית נתונים לסוכני GUI ניידים

בעידן שבו אינטראקציה בין אדם למחשב הופכת חכמה יותר, סוכני GUI בנייד הם המפתח להתקדמות. החוקרים מציגים את M²-Miner, מסגרת כריית נתונים אוטומטית בעלות נמוכה ראשונה מסוגה. קראו כיצד היא משנה את חוקי המשחק. קראו עכשיו!

קרא עוד