מודלי שפה גדולים (LLMs) הפכו לחלק בלתי נפרד מחיינו, וככל שהם הופכים ליכולים ונגישים יותר, כך גדלים האתגרים סביב בטיחותם. חברות הפיתוח משקיעות משאבים אדירים באימון המודלים כדי למנוע יצירת תכנים מזיקים. לדוגמה, אנו מכווננים את קלוד (Claude) לסרב להגיב לשאילתות משתמשים הכרוכות בייצור נשק ביולוגי או כימי.
עם זאת, המודלים עדיין חשופים ל"פריצות מגבלות" (jailbreaks): קלטים שתוכננו לעקוף את מנגנוני ההגנה שלהם ולאלץ אותם להפיק תגובות מזיקות. חלק מפריצות המגבלות מציפות את המודל בפרומפטים ארוכים מאוד; אחרות משנות את סגנון הקלט, למשל על ידי שימוש באותיות גדולות וקטנות באופן חריג. היסטורית, קשה היה לזהות ולחסום פריצות מגבלות: התקפות מסוג זה תוארו כבר לפני למעלה מ-10 שנים, ועדיין, למיטב ידיעתנו, אין כיום מודלי למידה עמוקה שהם חסינים לחלוטין מפני התקפות כאלה ונמצאים בפריסה מבצעית.
כדי שנוכל לפרוס בעתיד מודלים בעלי יכולות הולכות וגדלות בצורה בטוחה, אנו מפתחים הגנות טובות יותר מפני פריצות מגבלות. במסגרת מדיניות הסקיילינג האחראי שלנו, אנו יכולים לפרוס מודלים כאלה כל עוד אנו מצליחים למתן סיכונים לרמות מקובלות באמצעות מנגנוני הגנה מתאימים – אך פריצת מגבלות מאפשרת למשתמשים לעקוף את ההגנות הללו. בפרט, אנו מקווים שמערכת המוגנת על ידי 'מנגנוני סיווג חוקתיים' (Constitutional Classifiers) תאפשר לנו למתן סיכוני פריצות מגבלות עבור מודלים שעברו את סף יכולות ה-CBRN המפורט במדיניות הסקיילינג האחראי שלנו (הכוונה למערכות המסוגלות לסייע משמעותית לאנשים עם רקע טכני בסיסי ליצור, להשיג ולפרוס נשק כימי, ביולוגי, רדיולוגי או גרעיני, ובכך להציג סיכון גבוה משמעותית לשימוש לרעה הרסני). במאמר החדש שלנו, אנו מתארים מערכת המבוססת על 'מנגנוני סיווג חוקתיים' המגנה על מודלים מפני פריצות מגבלות. מסווגים אלו הם מסווגי קלט ופלט שאומנו על נתונים שנוצרו באופן סינתטי, והם מסננים את הרוב המכריע של פריצות המגבלות עם מינימום סירובי יתר (over-refusals) וללא עלויות מחשוב גבוהות.
מבחני Red Teaming אנושיים: עמידות ראשונית
כדי לבחון את יעילותם של מנגנוני הסיווג החוקתיים, ביצענו שני סוגים עיקריים של בדיקות. ראשית, פיתחנו גרסת אב-טיפוס של המערכת שנועדה לזהות ולחסום ידע מדעי ספציפי הקשור לנזקים כימיים, ביולוגיים, רדיולוגיים וגרעיניים (CBRN). לאחר מכן, הזמנו פורצי מגבלות עצמאיים להשתתף בתוכנית Bug Bounty, בה אותגרו לבצע Red Teaming למערכת, כלומר, לנסות לשבור אותה בתנאי ניסוי כדי לבחון את חוסנה.
במסגרת האתגר, המשתתפים קיבלו רשימה של עשר שאילתות "אסורות" ומשימתם הייתה להשתמש בכל טכניקות פריצת מגבלות שיבחרו כדי לגרום לאחד מהמודלים הנוכחיים שלנו (במקרה זה, Claude 3.5 Sonnet, יוני 2024), המוגן על ידי אב-טיפוס של מנגנוני הסיווג החוקתיים, לענות על כל השאילתות. פריצת מגבלות "אוניברסלית" נחשבה מוצלחת רק אם המודל סיפק תשובה מפורטת לכל השאילתות.
במהלך תקופה ניסויית של חודשיים, 183 משתתפים פעילים הקדישו למעלה מ-3,000 שעות משוערות בניסיון לפרוץ את המודל. הם הוצעו תגמול כספי של עד 15,000 דולר אם יגלו פריצת מגבלות אוניברסלית. למרות המאמץ העצום, אף אחד מהמשתתפים לא הצליח לכפות על המודל לענות על כל עשר השאילתות האסורות באמצעות פריצת מגבלות יחידה – כלומר, לא התגלתה פריצת מגבלות אוניברסלית.
למרות עמידותו בפני פריצות מגבלות, לאב-טיפוס זה היו כמה בעיות: הוא סירב למספר רב מדי של שאילתות תמימות (over-refusals) ודרש משאבי מחשוב רבים לתפעולו. מערכת עם שתי בעיות אלו עשויה להיות בטוחה יותר, אך לא בהכרח מעשית לפריסה. מאז, שיפרנו את המערכת שלנו כדי להשיג רמת עמידות דומה תוך הפחתה משמעותית של בעיות אלו.
שיפור דרמטי: תוצאות מבחנים אוטומטיים
במקביל למבחנים האנושיים, ביצענו סדרת הערכות אוטומטיות, בהן יצרנו באופן סינתטי 10,000 פרומפטים של פריצות מגבלות. אלה כללו רבות מההתקפות היעילות ביותר על מודלי LLM קיימים, וכן התקפות שתוכננו לעקוף מנגנוני הגנה מבוססי מסווגים. בחנו את הפרומפטים הללו על גרסה של Claude 3.5 Sonnet (אוקטובר 2024) המוגנת על ידי מנגנוני סיווג חוקתיים, ועל גרסה של קלוד ללא מסווגים.
בתנאי הבסיס, ללא מסווגים הגנתיים, שיעור ההצלחה של פריצות המגבלות עמד על 86% – כלומר, קלוד עצמו חסם רק 14% מניסיונות פריצת המגבלות המתקדמים הללו. עם זאת, הגנה על קלוד באמצעות מנגנוני סיווג חוקתיים הניבה שיפור משמעותי: שיעור ההצלחה של פריצות המגבלות ירד ל-4.4% בלבד, מה שאומר שיותר מ-95% מניסיונות פריצת המגבלות נחסמו.
במקביל, מנגנוני הסיווג החוקתיים שלנו לא הגדילו באופן מהותי את שיעור סירובי היתר לשאילתות משתמשים תמימות: עם המסווגים, לקלוד היה שיעור סירוב מוגבר קלות (ב-0.38%), אך עלייה זו לא הייתה מובהקת סטטיסטית במדגם אקראי של 5,000 שיחות. לבסוף, עלות המחשוב הייתה גבוהה במעט (ב-23.7%) מזו של המודל הלא מוגן. אנו ממשיכים לפעול להפחתת הסירובים ועלויות המחשוב עוד יותר ככל שאנו משכללים את הטכניקה.
בסך הכל, הניתוחים האוטומטיים שלנו מצאו כי גרסה מעודכנת זו של מערכת מנגנוני הסיווג החוקתיים שיפרה באופן דרמטי את חוסנו של מודל ה-AI נגד פריצת מגבלות – ועשתה זאת בעלות נוספת מינימלית בלבד.
כיצד זה עובד? הבסיס החוקתי
העיקרון מאחורי מנגנוני סיווג חוקתיים מבוסס על תהליך דומה ל-AI חוקתי (Constitutional AI), טכניקה נוספת שבה השתמשנו כדי לבצע יישור לקלוד (Claude). שתי הטכניקות משתמשות ב"חוקה": רשימה של עקרונות שהמודל צריך לדבוק בהם. במקרה של מנגנוני סיווג חוקתיים, העקרונות מגדירים את סוגי התוכן המותרים והאסורים (לדוגמה, מתכונים לחרדל מותרים, אך מתכונים לגז חרדל אינם מותרים).
בסיוע של קלוד עצמו, אנו משתמשים ב"חוקה" זו כדי לייצר מספר רב של פרומפטים סינתטיים והשלמות מודל סינתטיות על פני כל קטגוריות התוכן. אנו מעשירים את הפרומפטים וההשלמות הללו כדי להבטיח רשימה מגוונת: זה כולל תרגומם לשפות שונות ושינוי סגנונם כך שיכתבו בסגנון של פריצות מגבלות ידועות.
לאחר מכן, אנו משתמשים בנתונים הסינתטיים הללו כדי לאמן את מסווגי הקלט והפלט שלנו לסמן (ולחסום) תוכן שעלול להיות מזיק בהתאם ל"חוקה" הנתונה. כדי למזער סירובי יתר (כלומר, תוכן לא מזיק המסומן בטעות כמזיק), אנו מאמנים את המסווגים גם על סט קבוע של שאילתות תמימות שנוצרו על ידי קבלן חיצוני.
מגבלות והדרך קדימה
חשוב לציין כי מנגנוני סיווג חוקתיים אינם מונעים בהכרח כל פריצת מגבלות אוניברסלית. עם זאת, אנו מאמינים כי גם השיעור הקטן של פריצות מגבלות שמצליחות לעבור את המסווגים שלנו דורש מאמץ רב בהרבה כדי לגלותן כאשר מנגנוני ההגנה פעילים. ייתכן גם שיתפתחו בעתיד טכניקות חדשות לפריצת מגבלות שיהיו יעילות נגד המערכת; לכן, אנו ממליצים להשתמש בהגנות משלימות. יחד עם זאת, ה"חוקה" המשמשת לאימון המסווגים ניתנת להתאמה מהירה כדי לכסות התקפות חדשות ככל שיתגלו.
לפרטים נוספים אודות שיטת מנגנוני הסיווג החוקתיים והמסווגים עצמם, ניתן לעיין במאמר המלא.



