בעידן שבו מודלי שפה גדולים (LLMs) עוברים כיוונון עדין רציף על ידי משתמשים, מתגלה איום חדש: התקפות דלת אחורית שמתנהגות כמו טרויאנים עקשניים. עד כה, מחקרים בדקו בעיקר את יעילות ההתקפות מיד לאחר השקת המודל, אך לא את עמידותן בעדכונים. לפי המחקר החדש, התקפות מסורתיות מאבדות כוח עם הזמן. החוקרים מציגים את P-Trojan, אלגוריתם התקפה שמתאים עצמו לעדכונים ומבטיח הישרדות. (72 מילים)
התקפות דלת אחורית מטמיעות התנהגות זדונית במודל, שמופעלת בעזרת טריגר ספציפי ומאפשרת פלטים מזיקים או עקיפת בקרות בטיחות. המחקר בוחן כיצד התקפות כאלה שורדות כיוונון עדין רב-שלבי לאחר הפריסה. P-Trojan פועל על ידי יישור גרדיאנטים מורעלים עם אלה של משימות נקיות על הטבעות הטוקנים, כך שהמפה הזדונית לא נמחקת או מדוכאת. ניתוח תיאורטי מאשש את היתכנות התקפה כזו. (92 מילים)
בניסויים על משפחות Qwen2.5 ו-LLaMA3, עם רצפי משימות מגוונים, P-Trojan השיג מעל 99% עמידות בהתקפות דלת אחורית תוך שמירה על דיוק במשימות נקיות. זהו שיפור דרמטי לעומת שיטות קודמות, שמאבדות יעילות לאחר עדכונים. הממצאים מראים כי איומים כאלה מציאותיים במשימות הסתגלות מודל בפועל. (85 מילים)
המשמעות לבתי עסק ישראליים שמשתמשים ב-LLMs פתוחים היא חמורה: מודלים כאלה עלולים לשאת התקפות נסתרות שמתגלות רק לאחר זמן. בהשוואה לשיטות קודמות, P-Trojan מדגים כיצד התקפות יכולות להתאים עצמן לסביבות דינמיות. זה מדגיש צורך בהערכה שמתחשבת בעמידות וביטחונות חזקים יותר נגד התקפות כאלה. (82 מילים)
הממצאים קוראים לפיתוח הגנות חדשות שמתמודדות עם כיוונון רציף, כמו בדיקות טריגרים מתמשכות או אימות גרדיאנטים. עבור מנהלי טכנולוגיה, חשוב לבחון ספקי מודלים על עמידותם לאיומים ארוכי טווח ולשקול כלים לניטור התנהגות חריגה. האם המודלים שלכם מוגנים מפני טרויאנים עקשניים? (68 מילים)