האם ניתן להבין כיצד מיליוני משתמשים מנצלים צ'אטבוטי AI כמו Gemini או ChatGPT מבלי לפגוע בפרטיותם? חוקרי גוגל ריסרץ' ענו על השאלה הזו במסגרת חדשה בשם Urania, שמאפשרת תובנות ברמה גבוהה על דפוסי שימוש – מכתיבת אימיילים ועד תכנון נסיעות – תוך ערבויות פרטיות דיפרנציאלית (DP) קפדניות. השיטה מבטיחה כי שיחה בודדת לא תשפיע יתר על המידה על התוצאות, ומספקת כלי חיוני לשיפור פלטפורמות AI.
המסגרת Urania פורסמת בכנס COLM 2025 על ידי אלכסנדר נופ ודאוגאו ליו מגוגל ריסרץ'. היא מבוססת על צינור עיבוד בשלושה שלבים: קיבוץ DP של שיחות שהומרו לווקטורים (embeddings), חילוץ מילות מפתח ב-DP באמצעות היסטוגרמות רועשות, ולבסוף סיכום LLM על בסיס מילות המפתח בלבד. השיטה משלבת תכונות DP כמו post-processing ו-composition כדי להבטיח פרטיות מקצה לקצה, ללא תלות ביכולת LLM לנקות PII באופן cliffי.
בניגוד לגישות קודמות כמו CLIO, שמסתמכות על הנחיות cliffיות ל-LLM להסרת מידע מזהה אישי, Urania מספקת ערבויות מתמטיות. מילות המפתח נבחרות משלוש שיטות: LLM מודרך, TF-IDF ב-DP או בחירה מרשימה מוגדרת מראש. הרעש בהיסטוגרמות מבטיח שרק מונחים נפוצים יבלטו, ומסתיר מונחים ייחודיים או רגישים. LLM רואה רק את מילות המפתח הללו, מה שמונע חשיפת תוכן מקורי.
השיטה נבחנה מול בסיסל ליין לא פרטי (Simple-CLIO), והראתה איזון טוב בין פרטיות לתועלת. ככל שהתקציב הפרטי (ε) נמוך יותר, כך המסכמים כלליים יותר, אך במבחנים עיוורים העדיפו שופטי LLM את המסכמים הפרטיים עד 70% מהזמן – כי הם ממוקדים ומדויקים יותר. בדיקת התקפת השתייכות (membership inference) הראתה הגנה חזקה: AUC של 0.53 (קרוב לניחוש אקראי), לעומת 0.58 בבסיסליין.
בהקשר עולמי, המסגרת רלוונטית במיוחד לפלטפורמות AI גדולות כמו גוגל, שמתמודדות עם מיליארדי שיחות יומיות. היא מאפשרת אכיפת מדיניות בטיחות ושיפור שירותים מבלי לסכן פרטיות. בישראל, שבה חברות טק כמו Mobileye ו-Wix משלבות AI, כלים כאלה יכולים לסייע בפיתוח מוצרים אמינים תוך עמידה בתקנות GDPR וחוק הגנת הפרטיות.
המסגרת מדגימה כיצד DP יכולה להתגבר על אתגרי ניתוח טקסטים גדולים. היא עמידה בפני התקפות prompt injection ומבטיחה תוצאות אמינות גם אם מילות מפתח מכילות PII. לעומת זאת, גישות cliffיות עלולות להיכשל כמודלים משתפרים.
מבט קדימה כולל התאמה לסביבות מקוונות, מנגנוני DP מתקדמים יותר ושילוב מולטי-מודלי (תמונות, וידאו). זהו צעד חשוב לבניית AI אחראי.
מה זה אומר לעסקים ישראליים? כדאי לבחון כלים כאלה כבר עכשיו כדי להפיק תובנות משימושי AI פנימיים – ולהישאר צעד אחד קדימה בתחרות.