מחקר
3 דקות
מ־arXiv cs.AI
ChatGPT וג'מיני נכשלו במבחן CSAT הקוריאני
מחקר חדש בדק כיצד GPT-4o וג'מיני מתמודדים עם מבחן מדעי קוריאני ומצא חולשות חשיבה יסודיות. קראו עכשיו על טעויות התפיסה וההלוצינציות שמאפשרות לעצב מבחנים עמידים ל-AI.
קרא עודמחקר חדש בדק כיצד GPT-4o וג'מיני מתמודדים עם מבחן מדעי קוריאני ומצא חולשות חשיבה יסודיות. קראו עכשיו על טעויות התפיסה וההלוצינציות שמאפשרות לעצב מבחנים עמידים ל-AI.
קרא עודהאם VLMs מבינים פיזיקה אמיתית? PRiSM, בנצ'מרק חדש עם 24K+ בעיות, חושף כשלים בחשיבה מדעית באמצעות קוד פייתון. קראו עכשיו להבין את ההשלכות על AI עסקי. (112 מילים)
קרא עוד