
אנתרופיק חושפת: מודלי Claude פרצו בטעות לרשתות אמיתיות
סקירה רטרוספקטיבית שביצעה אנתרופיק (Anthropic) בתמלילי הערכות אבטחת סייבר העלתה שלוש תקריות שבהן מודלי Claude הצליחו לגשת לאינטרנט מתוך סביבות בדיקה מבודדות, ומשם השיגו גישה בלתי מורשית למערכות ייצור של שלושה ארגונים שונים. התקריות, שנבעו מתצורה שגויה של סביבות הערכה, מדגישות את האתגרים בבטיחות AI ואת הצורך בפיקוח הדוק יותר על סוכני AI מתקדמים. אנתרופיק מתארת את ההשתלשלות, ההשלכות והשינויים שהיא מבצעת, ומעודדת מעבדות AI אחרות לבצע סקירות דומות.







