חיפוש בחדשות

30 תוצאות עבור "למידה מחוזקת".

בונוסי ערך משגיאות אנсамבל לחקר בלמידה מחוזקת
מחקר
4 דקות
מ־arXiv cs.AI

בונוסי ערך משגיאות אנсамבל לחקר בלמידה מחוזקת

שיטת VBE החדשה משתמשת בשגיאות אנсамבל לבונוסי ערך שמעודדים חקר ראשוני ועמוק בלמידה מחוזקת. היא עלתה על Bootstrap DQN, RND ו-ACB בסביבות קלאסיות ואטארי. גלו כיצד זה משפיע על סוכני AI עסקיים. [קראו עוד](/services/ai-agents)

קרא עוד
למידה מחוזקת משדרגת הסרת פסולת חלל מרובה
מחקר
2 דקות
מ־arXiv cs.AI

למידה מחוזקת משדרגת הסרת פסולת חלל מרובה

בעידן שבו סביבת המסלול סביב כדור הארץ מתמלאת בפסולת חללית, מחקר חדש מציג מסגרת למידה מחוזקת לשיפור התחמקות התנגשויות במשימות ADR עם לוויינים קטנים. קראו עכשיו על הפתרון המתקדם.

קרא עוד
TSPO: שובר את דילמת ההומוגניזציה הכפולה בלמידה מחוזקת ל-LLM
מחקר
3 דקות
מ־arXiv cs.AI

TSPO: שובר את דילמת ההומוגניזציה הכפולה בלמידה מחוזקת ל-LLM

בעידן שבו מודלים גדולים של שפה מתמודדים עם משימות מורכבות באמצעות חיפוש איטרטיבי, TSPO פותרת את דילמת ההומוגניזציה הכפולה ומשפרת ביצועים ב-24%. קראו את המחקר המלא עכשיו! (48 מילים)

קרא עוד
UCPO: אופטימיזציה מודעת אי-ודאות למדיניות במודלי שפה גדולים
מחקר
2 דקות
מ־arXiv cs.AI

UCPO: אופטימיזציה מודעת אי-ודאות למדיניות במודלי שפה גדולים

בעידן שבו דגמי שפה גדולים משמשים ביישומים קריטיים, הזיות מגבילות אותם. UCPO – אופטימיזציה מודעת אי-ודאות – פותרת הטיות בלמידה מחוזקת ומשפרת אמינות. קראו עכשיו על הפריצה הזו! (112 מילים)

קרא עוד
חוקרים משפרים קריאת פונקציות ב-LLMs בגישה עוינת חדשה
מחקר
2 דקות
מ־arXiv cs.AI

חוקרים משפרים קריאת פונקציות ב-LLMs בגישה עוינת חדשה

מודלי שפה גדולים זקוקים ליכולות קריאת פונקציות חזקות כדי להתחבר לכלים חיצוניים. מחקר חדש מציג שיטת הגברת נתונים עוינת מבוססת RL שמזהה חולשות ומשפרת עמידות. קראו עכשיו על הגישה שמשנה את כללי המשחק.

קרא עוד
מכמות פסיבית לסיגנל פעיל: כימות אי-ודאות ב-LLM
מחקר
2 דקות
מ־arXiv cs.AI

מכמות פסיבית לסיגנל פעיל: כימות אי-ודאות ב-LLM

בעידן שבו דגמי שפה גדולים מציגים יכולות מרשימות אך אי-אמינות, סקר חדש חושף כיצד כימות אי-ודאות הפך לסיגנל בקרה פעיל בשלושה תחומים: היגיון, סוכנים ולמידה מחוזקת. קראו עכשיו!

קרא עוד
dUltra: מודלי שפה דיפוזיה מהירים בעזרת למידה מחוזקת
מחקר
3 דקות
מ־arXiv cs.AI

dUltra: מודלי שפה דיפוזיה מהירים בעזרת למידה מחוזקת

בעידן שבו מהירות עיבוד שפה טבעית קובעת את קצב החדשנות בעסקים, חוקרים מפתחים את dUltra – מסגרת למידה מחוזקת חדשה שמאיצה באופן דרמטי את מודלי השפה הדיפוזיה המוסתרים (MDLMs). קראו את הפרטים המלאים עכשיו.

קרא עוד
חיזוי ולמידה מחוזקת: נהיגה שיתופית בטוחה יותר לרכבים אוטונומיים
מחקר
3 דקות
מ־arXiv cs.AI

חיזוי ולמידה מחוזקת: נהיגה שיתופית בטוחה יותר לרכבים אוטונומיים

רכבים אוטונומיים מתקשים להתמודד עם נהגים אנושיים משתנים. חוקרים מציעים שילוב חיזוי ולמידה מחוזקת שיתופית לשיפור בטיחות ויעילות. קראו על HPN ו-VFN שמשנים את חוקי המשחק. קראו עכשיו!

קרא עוד