בעולם הבינה המלאכותית שבו וידאו, אודיו וטקסט מתמזגים, סגמנטציה אודיו-ויזואלית מוכוונת שפה (Ref-AVS) מאפשרת לזהות ולסמן אובייקטים מטרה על פי תיאורים טבעיים בשפה אנושית. אולם, מעבר לייצור מסכות סגמנטציה, נותרה שאלה קריטית: כיצד ניתן להעריך את איכותן ללא השוואה ישירה לאמת מקור? חוקרים מפרסמים מאמר חדש ב-arXiv שמציג משימה חדשה בשם MQA-RefAVS – הערכת איכות מסכות בהקשר Ref-AVS, שמספקת אבחון מפורט ומבוסס.
המשימה החדשה, MQA-RefAVS, דורשת ממערכת AI לקבל קלטים אודיו-ויזואליים ולשוניים לצד מסכת סגמנטציה מועמדת, ולהעריך את איכותה באופן עצמאי. לפי המאמר, המערכת חייבת להעריך את ה-IoU (מדד החפיפה) מול אמת מקור בלתי נראית, לזהות את סוג השגיאה הרלוונטי – גיאומטרי או סמנטי – ולהמליץ על החלטת בקרת איכות מעשית. גישה זו מאפשרת זיהוי כשלים בסגמנטציה בזמן אמת, ללא צורך בהכשרה על נתונים מוקדמים.
כדי לתמוך במשימה זו, החוקרים בנו את MQ-RAVSBench – מבחן מקיף שכולל מגוון רחב של מצבי שגיאה במסכות, החל מבעיות גיאומטריות כמו חורים או גבולות לא מדויקים, ועד שגיאות סמנטיות כמו סימון אובייקט שגוי. המבחן מייצג אתגרים אמיתיים מעולמות הווידאו והאודיו, ומספק בסיס איתן לבדיקת מודלים.
המאמר מציג גם את MQ-Auditor, מודל מבוסס מודל שפה גדול רב-מודלי (MLLM), שמנתח רמזים רב-מודליים ומסכות כדי לייצר הערכות כמותיות ואיכותיות. ניסויים מקיפים מראים כי MQ-Auditor עולה על מודלי MLLM פתוחים ומסחריים קיימים, ומאפשר שילוב קל במערכות Ref-AVS קיימות לאיתור כשלים ושיפור סגמנטציה עתידית.
הפיתוח הזה פותח דלתות ליישומים עסקיים בתחומי מעקב וידאו, ניתוח מדיה ואוטומציה תעשייתית. עבור מנהלי טכנולוגיה בישראל, שמשקיעים ב-AI רב-מודלי, MQ-Auditor יכול לשפר את אמינות מערכות סגמנטציה. הנתונים והקוד ישוחררו בקרוב ב-GitHub – הזדמנות לבדוק ולשלב בפרויקטים מקומיים.