בעידן שבו דגמי שפה גדולים (LLM) שולטים בשיחות דיגיטליות, מנגנוני הבטיחות שלהם חסומים בפני תכנים מסוכנים גלויים – אך נכשלים מול הסוואות מתוחכמות. משתמשים זדוניים משנים ניסוחים כדי לשמר כוונות מזיקות תוך הופעה תמימה, ויוצרים פער קריטי באימון הבטיחות. כדי לגשר על הפער הזה, חוקרים מציגים את HarmTransform – מסגרת דיון רב-סוכנים שמערבלת ביקורת והשלמות איטרטיביות כדי להפוך שאילתות מזיקות לצורות סמויות יותר, מבלי לאבד את הכוונה המקורית. המסגרת הזו מייצרת נתוני אימון איכותיים לשיפור עתידי של בטיחות LLM.
HarmTransform פועלת באמצעות סוכנים מרובים שמתווכחים זה עם זה: סוכן אחד מציע שינוי, אחרים מבקרים ומשפרים אותו בסבבים חוזרים. התהליך מבטיח שהשאילתות החדשות נשארות יעילות בהעברת כוונה מזיקה, אך קשות יותר לזיהוי. לפי הדיווח, המסגרת עולה על שיטות בסיסיות סטנדרטיות ביצירת טרנספורמציות אפקטיביות, מה שהופך אותה לכלי רב עוצמה לאיסוף נתונים לבטיחות.
בניסויים, HarmTransform הוכיחה עליונות בייצור שאילתות סמויות איכותיות. עם זאת, הניתוח חושף את הצד הכפול של דיון רב-סוכנים: מצד אחד, הוא מחדד את ההסוואות ומשפר את העמידות בפני זיהוי; מצד שני, הוא עלול להכניס שינויי נושא או מורכבות מיותרת. תובנות אלה מדגישות את הפוטנציאל לצד המגבלות של הגישה הזו ביצירת נתוני אימון מקיפים.
המשמעות העסקית של HarmTransform גדולה במיוחד עבור חברות ישראליות המפתחות AI, כמו סטארט-אפים בתחום הבטיחות הדיגיטלית. בעוד שגישות קיימות מתמקדות באיומים גלויים, המסגרת הזו מאפשרת אימון על תרחישים ריאליסטיים יותר, ומפחיתה סיכונים כמו דליפת מידע רגיש או תוכן מזיק. בהשוואה לשיטות פשוטות, היא מציעה כיסוי רחב יותר של איומים סמויים.
עבור מנהלי טכנולוגיה, HarmTransform פותחת דלת לשיפור מערכות AI קיימות. על ידי שילוב טרנספורמציות כאלה באימון, ניתן לחזק את ההגנות מפני עקיפות מתוחכמות. המחקר מדגיש את הצורך בגישות דינמיות יותר לבטיחות, ומזמין פיתוח נוסף כדי להתמודד עם החסרונות. מה תהיה ההשפעה על כלי AI בישראל?