חיפוש בחדשות

13 תוצאות עבור "jailbreak".

קלות מבהילה: כלי אוטומטי פרץ מנגנוני אבטחה של מודלי על
חדשות
4 דקות
מ־Wired

קלות מבהילה: כלי אוטומטי פרץ מנגנוני אבטחה של מודלי על

כתבה המבוססת על דיווח במגזין WIRED חושפת מבדק בטיחות מקיף שערך ארגון FAR.AI על מודלי בינה מלאכותית מובילים של ארבע חברות אמריקאיות גדולות. הבדיקה, שהשתמשה בכלי אוטומטי המייצר למעלה מאלף גרסאות של פניות בעייתיות, גילתה כי מודל Grok של SpaceXAI ומודל Gemini של גוגל פגיעים במיוחד לפריצה (Jailbreak), בעוד מודלי אנתרופיק ו-OpenAI הציגו חסינות מלאה למתקפה הספציפית. הדוח מדגיש את העלויות הנמוכות להפליא של הפעלת מתקפות אלו ואת הצורך הגובר ברגולציה חיצונית כפויה על התעשייה.

קרא עוד
ממשל טראמפ מסיר מגבלות יצוא על בינה מלאכותית של Anthropic
חדשות
4 דקות
מ־Wired

ממשל טראמפ מסיר מגבלות יצוא על בינה מלאכותית של Anthropic

ממשל טראמפ (Donald Trump) החליט להסיר את מגבלות היצוא על מודלי הבינה המלאכותית המתקדמים ביותר של חברת Anthropic (אנתרופיק) – Claude Mythos 5 ו-Claude Fable 5. ההסדר הושג לאחר שבועות של מתיחות מול משרד המסחר האמריקאי, Commerce Department, בהם נאלצה החברה להשבית זמנית את הגישה למודל Fable 5 בעקבות חששות מפריצות אבטחה (Jailbreaks) המאפשרות יכולות סייבר התקפיות. בעקבות מכתב רשמי ששלח מזכיר המסחר Howard Lutnick (הווארד לוטניק), הותר יצוא והפצת המודלים ללא צורך ברישיונות מיוחדים. החברה התחייבה בתמורה לפתח מנגנוני הגנה מחמירים ולשתף פעולה באופן הדוק עם הממשל באיתור סיכונים. להסרת המגבלות השפעה ישירה על חברות ישראליות המפתחות סוכני AI ופתרונות אוטומציה מתקדמים על בסיס מודלי החברה.

קרא עוד
עימות בצמרת ה-AI: הממשל האמריקאי מסרב להסיר את מגבלות הייצוא מ-Claude Fable 5
חדשות
4 דקות
מ־Wired

עימות בצמרת ה-AI: הממשל האמריקאי מסרב להסיר את מגבלות הייצוא מ-Claude Fable 5

פגישת החירום בוושינגטון בין ראשי חברת Anthropic לממשל האמריקאי הסתיימה ללא פתרון למשבר Claude Fable 5. הממשל מסרב להסיר את מגבלות הייצוא החמורות שהוטלו על המודל החדש בשבוע שעבר עקב חששות מפרצות אבטחה המאפשרות מעקף (Jailbreaking) של מנגנוני הבטיחות. בבית הלבן וב-NSA חוששים כי משתמשים יוכלו לגשת ליכולות הסייבר והלחימה הבלתי-מפוקחות של מודל האם החסוי, Claude Mythos. חברות טכנולוגיה ומפתחי AI ברחבי העולם, ובהם גם עסקים ישראליים, עוקבים בדאגה אחר המהלך התקדימי, הממחיש את הסיכון הממשי שבהסתמכות על ספק AI יחיד ואת הצורך בבניית תשתית גיבוי מבוזרת ורב-מודלית לכל מערך האוטומציה בארגון.

קרא עוד
השבתת מודלי AI של אנתרופיק: ארה"ב עצרה את הגישה ל-Claude Fable 5
חדשות
4 דקות
מ־TechCrunch

השבתת מודלי AI של אנתרופיק: ארה"ב עצרה את הגישה ל-Claude Fable 5

צו חירום של ממשל ארה"ב הורה לחברת Anthropic להשבית מיידית ובאופן גלובלי את הגישה לשני מודלי ה-AI החזקים ביותר שלה: Claude Fable 5 ו-Claude Mythos 5. המהלך הדרמטי, שהוגדר כפעולת פיקוח על ייצוא בעקבות חשש לפריצת אבטחה (jailbreak) צרה, מגיע ימים בודדים בלבד לאחר השקת Fable 5 לציבור הרחב. המקרה מדגיש את סיכוני הרגולציה והתלות של עסקים במודל יחיד, ומחייב חברות ישראליות לבנות אסטרטגיות מרובות מודלים עם תשתיות אינטגרציה גמישות לצמצום הפגיעה ברציפות התפעולית שלהן.

קרא עוד
ממשל ארה"ב נגד אנתרופיק: Claude Fable 5 מוסר מהאוויר במפתיע
חדשות
4 דקות
מ־Wired

ממשל ארה"ב נגד אנתרופיק: Claude Fable 5 מוסר מהאוויר במפתיע

דרמה בעולם הבינה המלאכותית: חברת Anthropic הודיעה על השבתה מיידית של שני מודלים שהשיקה השבוע, Claude Fable 5 ו-Mythos 5, בעקבות צו פיקוח ייצוא דחוף שקיבלה מממשל ארה"ב. הממשל חושש כי גורמים עוינים גילו שיטה לפרוץ את מנגנוני ההגנה של הדגמים (Jailbreak) ולנצל אותם לגילוי חולשות אבטחה וסייבר. למרות שחברת אנתרופיק טוענת כי הפירצה שהתגלתה היא צרה ואינה מסוכנת באופן חריג, היא נאלצה להסיר את הגישה לכלל לקוחותיה כדי לעמוד בדרישות הרגולציה הממשלתית. המקרה מדגיש את החשיבות הקריטית של אבטחת מודלי שפה גדולים בארגונים.

קרא עוד
סיכוני קוד AI אוטונומי: למה עסקים בישראל חייבים בקרה
ניתוח
5 דקות
מ־AI Weekly

סיכוני קוד AI אוטונומי: למה עסקים בישראל חייבים בקרה

**קוד AI אוטונומי הוא שימוש בסוכנים שמייצרים, מריצים ומשנים קוד כמעט ללא מגע יד אדם.** ארבע תקריות שפורסמו יחד — אירוע Sev 1 ב-Meta, העלאת קוד ל-npm ב-Anthropic, שימוש ב-Claude Code בקמפיין ריגול עם 90% אוטונומיה ומחקר על jailbreak בין מודלים — מבהירות שהסיכון עבר מאיכות תשובות לסיכון תפעולי ואבטחתי. עבור עסקים בישראל, הלקח מעשי: לא לחבר סוכן קוד ישירות ל-GitHub, ל-Zoho CRM, ל-WhatsApp Business API או ל-N8N בלי הרשאות מינימום, sandbox, לוגים ואישור ידני לפני publish או שינוי במערכות לקוח.

קרא עוד
Dual-Cycle ל-Agentי משחק תפקידים: נאמנות לדמות בלי להיפרץ
מחקר
6 דקות
מ־arXiv cs.AI

Dual-Cycle ל-Agentי משחק תפקידים: נאמנות לדמות בלי להיפרץ

**Dual-Cycle Adversarial Self-Evolution הוא מנגנון הגנה ללא אימון לסוכני משחק תפקידים ב-LLM: מחזור “תוקף” מייצר פרומפטים חזקים יותר ל-jailbreak, ומחזור “מגן” מזקק את הכשלים לבסיס ידע היררכי (כללי בטיחות, אילוצי פרסונה, ודוגמאות בטוחות).** לפי תקציר arXiv:2602.13234v1, בזמן ריצה המערכת שולפת ומרכיבה את הידע כדי לשמור גם על נאמנות לדמות וגם על בטיחות, ואף מדווחת על שיפור עקבי לעומת baseline-ים במודלים קנייניים. לעסקים בישראל שמפעילים שיחה עם לקוחות ב-WhatsApp, המשמעות פרקטית: במקום להסתמך רק על פרומפט מערכת, כדאי לנהל מדיניות ותשובות מאושרות בתוך CRM (כמו Zoho CRM) ולשלוף אותן בזמן אמת דרך N8N—כדי לצמצם סיכוני התחייבויות, מידע שגוי או הפרת פרטיות.

קרא עוד
זיהוי ניסיונות Jailbreak ב-LLM קליניים: מודל תכונות לשוניות אוטומטי
מחקר
6 דקות
מ־arXiv cs.AI

זיהוי ניסיונות Jailbreak ב-LLM קליניים: מודל תכונות לשוניות אוטומטי

**זיהוי Jailbreak ב-LLM קליניים הוא זיהוי סטיות לשוניות שמרמזות שמשתמש מנסה להוציא מערכת הדרכה רפואית מהקשר מקצועי, רפואי או אתי. במחקר arXiv:2602.13321v1 החוקרים החליפו תיוג ידני של 4 תכונות (מקצועיות, רלוונטיות רפואית, אתיקה והסחת הקשר) במודלים מבוססי BERT שמנבאים את הציונים מהטקסט, ואז מזינים אותם למסווג שמעריך הסתברות ל-Jailbreak.** למרות שהמיקוד קליני, השיטה רלוונטית גם לעסקים בישראל שמפעילים מערכות שיחה בוואטסאפ או צ׳אט: תכונות ברות-פרשנות מאפשרות לקבוע ספים, לתעד ב-CRM (כמו Zoho) ולהפעיל זרימות ב-N8N שמנתבות שיחות חשודות לנציג אנושי. היתרון: לא “לרדוף” אחרי ניסוחי עקיפה, אלא למדוד שינויי התנהגות בשפה.

קרא עוד
פרומורל-בנץ': איך עיצוב פרומפטים משפר בטיחות מוסרית ב-LLM
מחקר
6 דקות
מ־arXiv cs.AI

פרומורל-בנץ': איך עיצוב פרומפטים משפר בטיחות מוסרית ב-LLM

ProMoral-Bench (arXiv:2602.13274v1) הוא בנצ'מרק שמאפשר להשוות בצורה אחידה בין 11 אסטרטגיות פרומפטינג להשגת חשיבה מוסרית ובטיחות במודלי שפה, על בסיס סטים כמו ETHICS, Scruples ו-WildJailbreak, ובתוספת מבחן חוסן חדש ETHICS-Contrast. החוקרים מציעים מדד מאוחד בשם UMSS שמאזן בין דיוק מוסרי לבין עמידות לתוכן מזיק וג’יילברייק. לפי הממצאים, פרומפטים קומפקטיים עם דוגמאות few-shot עקביות מנצחים פרומפטים מרובי-שלבים: הם יציבים יותר תחת ניסוח מחדש, עמידים יותר לפריצות, וגם זולים יותר בטוקנים—נקודה קריטית למי שמפעיל שירות ב-WhatsApp Business API ומשלב נתונים מ-CRM כמו Zoho דרך N8N.

קרא עוד