לאחר הפריסה מחדש של Fable 5, שזמין כעת לכל המשתמשים ברחבי העולם, אנתרופיק משתפת פרטים נוספים אודות שני תחומים קריטיים: מנגנוני הגנה מפני סיכוני סייבר ומסגרת מוצעת לטיפול בפריצות מגבלות (jailbreaks) למודלי AI. היכולות הללו, שמבוססות על AI, מיועדות לאתר ולחסום שימושים מסוכנים או בעלי פוטנציאל להיות כאלה בתחום הסייבר. אנתרופיק מכירה בכך שאבטחת סייבר היא תחום מאתגר במיוחד עבור מנגנוני הגנה, שכן יכולות רבות הן 'דו-שימושיות' – יכולות לשמש למטרות מועילות או מזיקות כאחד. חשיפת המסגרת המשותפת נועדה לעודד דיון בתעשייה, באקדמיה ובממשלה בנוגע לקביעת סטנדרטים אחידים לתיאור חומרת פריצות מגבלות, במטרה לשפר את שיתוף הפעולה ולמנוע ניצול לרעה. אנו מקדמים בברכה משוב וביקורת על מסגרת זו בכתובת cyber-safeguards@anthropic.com, ופתחנו תוכנית HackerOne עבור חוקרי אבטחה.
בקצרה
אנתרופיק (Anthropic) מפרסמת פרטים נוספים אודות מנגנוני ההגנה שלה מפני סיכוני סייבר במודל Fable 5, בדגש על מסווגי הבטיחות (safety classifiers) הקובעים אילו פעולות חסומות ואילו מותרות. במקביל, החברה חושפת טיוטה ראשונית למסגרת הערכת חומרת פריצות המגבלות (jailbreaks) במודלי AI. מטרת המסגרת היא ליצור שפה אחידה לתקשורת בין מפתחי AI לממשלות בנוגע לסיכוני אבטחה, ולאפשר הגנה טובה יותר מפני ניצול לרעה של יכולות המודלים, תוך כדי התרת שימושים לגיטימיים.



