למה אנחנו מתייחסים ל-LLMs ברצינות כמקור פוטנציאלי לסיכון ביולוגי?
העבודה שלנו באנתרופיק (Anthropic) מונעת מהפוטנציאל של ה-AI לקדם תגליות מדעיות – במיוחד בתחומי הביולוגיה והרפואה – ולשפר את מצב האנושות. חברות כמו Benchling משתמשות ב-Claude כדי לסייע לחוקרים לבנות נתונים, לשאול שאלות טובות יותר, לייצר תובנות מהר יותר ולהקדיש יותר זמן למדע. גם Biomni משתמשת ב-Claude כדי להאיץ ניתוח ביו-אינפורמטי ואף להפוך את תכנון הניסויים לאוטומטי.
יחד עם זאת, AI היא במהותה טכנולוגיה דו-שימושית. עקרון מפתח במאמץ שלנו לפתח AI באחריות הוא לזהות, למדוד ולהפחית את הסיכויים שגורמים זדוניים ינצלו לרעה את אותן יכולות שהופכות את ה-AI למבטיח כל כך עבור מדענים וחדשנים.
כאשר אנתרופיק השיקה את Claude Opus 4, הפעלנו הגנות ברמת בטיחות AI 3 (ASL-3), שכללו אמצעי פריסה שהתמקדו באופן צר במניעת המודל מלסייע במשימות מסוימות הקשורות לפיתוח נשק כימי, ביולוגי, רדיולוגי וגרעיני (CBRN). כפי שציינו אז, זו הייתה החלטה מונעת – שיפור ביצועי המודל בהערכות שלנו אומר שלא יכולנו עוד לשלול בביטחון את יכולתו של המודל המתקדם ביותר שלנו להעצים אנשים עם רקע בסיסי בתחומי ה-STEM אם ינסו לפתח נשק כזה. בגלל הערכתנו את ההשלכות הפוטנציאליות, התמקדות ראשונית עיקרית בהערכות שלנו ובאמצעי הבטיחות המקבילים הייתה בנשק ביולוגי. בפוסט זה, אנו רוצים להרחיב את נקודת המבט שלנו על AI וסיכון ביולוגי (biorisk).
זה בולט – אך לא בהכרח אינטואיטיבי – שכל מסגרת בטיחות שפורסמה על ידי מעבדות AI חזיתיות כוללת התייחסות כלשהי לסיכון ביולוגי (biorisk). [1] אחרי הכל, מודלי שפה גדולים (LLMs) חזיתיים הם כלליים; הם בדרך כלל אינם מתמחים ביישומים ביולוגיים (בניגוד למודלי בסיס אחרים, כמו AlphaFold). ובגלל האופי הכללי הזה, קיימים איומי אבטחה רבים אחרים שיכולים לקבל עדיפות. אנו מבינים מדוע מישהו עשוי להיות סקפטי לגבי מתן עדיפות לסיכון ביולוגי בעת בחינת ההשלכות האבטחתיות של AI. פוסט זה יעסוק בכמה שאלות שעשויות להישאל על ידי סקפטי כזה.
מטרתנו אינה הפחדה; דיונים על AI וסיכון ביולוגי נמצאים בקטגוריה של תרחישים בעלי הסתברות נמוכה/השפעה גבוהה. [2] במקום זאת, אנו רוצים לקבוע מדוע אנו מאמינים שהערכת סיכונים אלו וההגנה מפניהם היא מרכיב קריטי בפיתוח AI אחראי.
מה הקשר בין AI לנשק מסוכן בכלל?
אנו חוששים כיצד ה-AI עשוי לסייע לגורמים זדוניים ברכישה ובפיתוח נשק, הן בגלל הדמיון שלו לטכנולוגיות מידע ותקשורת היסטוריות והן בגלל השוני שלו מהן.
בשנים האחרונות, קבוצות טרור אימצו במהירות טכנולוגיות כמו תקשורת מוצפנת, מטבעות קריפטוגרפיים ומדיה חברתית. לא צריכים לצפות למשהו שונה מה-AI. בדיוק כפי שאלו המחפשים מידע על בניית נשק עברו מהצורך לרכוש חוברות או מדריכים פיזיים לחיפוש באינטרנט, אנו יכולים לצפות שהם ישאלו את ה-AI.
מה ששונה, עם זאת, הוא הפוטנציאל של ה-AI לשמש כעוזר אמיתי. האינטרנט מלא במידע סותר ומטעה, ואתר אינטרנט אינו יכול לספק סיוע בזמן אמת אם נתקלים בקשיים בתהליך מורכב ובלתי מוכר. מודלי AI מתקדמים מספיק עשויים לשמש כמדריך למידע מהימן, כמקור לידע סמוי ובלתי נגיש אחרת לגבי יישום, וכעוזר מחקר המסוגל לעבד נתונים ולייצר תובנות באופן מיידי.
למה להתמקד בסיכון ביולוגי?
בתחום הגורמים המאיימים המחפשים סיוע מ-AI, סיכונים ביולוגיים – וסיכונים קטסטרופליים באופן כללי יותר – בהחלט אינם הדאגה היחידה. למעשה, אנו משקיעים משאבים ניכרים בחקר ההשלכות הפוטנציאליות של AI על אבטחת סייבר ובאיסוף מודיעין לגבי שימושים בפועל בפלטפורמות שלנו על ידי אלה שיגרמו נזק באמצעות הונאה, פיתוח נוזקות (malware) ופעולות השפעה, בין היתר.
עם זאת, לפחות שני גורמים הופכים את הסיכון הביולוגי למדאיג במיוחד. ראשית, ההשלכות הפוטנציאליות של התקפה ביולוגית מוצלחת הן חמורות במיוחד. ההשפעות של התקפה עם וירוס יכולות להתפשט הרבה מעבר ליעד הראשוני באופן שונה איכותית מנשק עם השפעות מקומיות יותר.
שנית, שיפורים בתחומים אחרים של ביוטכנולוגיה עשויים היו להוריד חלק מהחסמים החומריים ששימשו בעבר כהגנה ביולוגית "פסיבית". לדוגמה, העלות היורדת של סינתזת חומצות גרעין, סטנדרטיזציה של ערכות ריאגנטים וגישה קלה לציוד ביולוגיה מולקולרית סטנדרטי (כגון מכשירי PCR), הופכים רכישת חומרים לפחות צוואר בקבוק. מודלי AI מפחיתים עוד יותר חסמים למידע ולידע מעשי (know-how). כתוצאה מכך, שילוב זה של השלכות חמורות והסתברות הולכת וגוברת הופך את הטיפול בסיכון ביולוגי נוסף מ-AI לעדיפות חשובה.
האם מומחים לא יודעים יותר על ביולוגיה ממודלי AI?
מודלי LLM אומנו על כמויות עצומות של נתונים, החל ממודלים פיננסיים ועד לסיפורי מעריצים (fanfiction). במהלך אימון זה, הם לומדים משהו כמעט על הכל. מכיוון שנתוני האימון כוללים דברים כמו מאמרים מדעיים, ספרים ודיונים מקוונים על מדעי הביולוגיה, המודלים קולטים מידע על מבני חלבונים, טכניקות הנדסה גנטית, וירולוגיה וביולוגיה סינתטית, לצד כל השאר. מה שעשוי להיות מפתיע הוא המידה שבה ידע ביולוגי זה התרחב ככל שהמודלים השתפרו.
ודאי, קלוד ו-LLMs אחרים אינם מסוגלים כיום לעשות מדע באופן אוטונומי ברמת מומחה. עם זאת, בכמה הערכות שנועדו לבחון ידע הרלוונטי להיבטים מסוכנים פוטנציאלית בביולוגיה, המודלים מתקרבים – ולעיתים עולים על – ביצועים אנושיים ברמת מומחה.
בתוך שנה, קלוד עברה מלפגרת אחרי מומחים ברמה עולמית בהערכה שנועדה לבחון תרחישי פתרון בעיות בוירולוגיה במסגרת מעבדה, לעולה בנוחות על קו הבסיס הזה (ראו איור 1).

אנו רואים התנהגות זו של עלייה על ביצועי מומחים על פני מדדי ביצועים מרובים, במיוחד בביולוגיה מולקולרית.
יתרה מכך, קו הבסיס האנושי בהערכה זו מבוסס על מדענים העונים על שאלות בתחום התמחותם. כך שלא רק שמודלי LLM יכולים לפתח רוחב ידע על פני תחומי משנה שמומחים אנושיים מתקשים להשתוות אליו, אלא גם שבמקרים מסוימים מודלי LLM עולים על מומחים בתחום שלהם.
האם הידע של LLM שימושי בתרחיש יישומי?
בבחינת תרומת ה-AI לסיכון הביולוגי, אנו צריכים לדעת יותר מאשר רק כמה טוב הוא מבצע בחידון. אנו צריכים לבחון הערכות הכוללות אנשים אמיתיים, ומשקפות מקרוב את תרחישי האיום האמיתיים שלנו. יתרה מכך, בדיוק כפי שאנו מבצעים מדד ביצועים לידע של AI על ידי השוואתו למומחים, אנו צריכים למדוד את התועלת של AI על ידי השוואתו לחלופה הנגישה ביותר – במקרה זה, האינטרנט.
כדי לעמוד בשני קריטריונים אלה, ערכנו מספר ניסויים מבוקרים המודדים את יכולת ה-AI לסייע בתכנון תהליך תיאורטי של רכישת נשק ביולוגי. המשתתפים קיבלו עד יומיים לנסח תוכנית רכישת נשק ביולוגי מקיפה. לקבוצת הביקורת הייתה גישה רק למשאבי אינטרנט בסיסיים, בעוד שלקבוצה בסיוע מודל הייתה גישה נוספת ל-Claude ללא מנגנוני הגנה. (במקרים מוגבלים כאלה, חשוב לספק לגורמים מהימנים גישה לגרסה של המודל ללא מנגנוני הגנה על מנת להעריך במדויק יותר את היכולות המרביות של הטכנולוגיה). התוכניות שהתקבלו דורגו על ידי מומחי הגנה ביולוגית באמצעות מפתח הערכה מפורט המעריך שלבי מפתח במסלול הרכישה. משתתפים עם גישה למודלי Claude 4 – במיוחד Claude Opus 4 – קיבלו ציונים גבוהים בהרבה ופיתחו תוכניות עם באופן משמעותי פחות כשלים קריטיים בהשוואה לקבוצת הביקורת שהשתמשה רק באינטרנט.





