משתמשים רבים פונים ל-AI למגוון צרכים, כולל לעיתים תמיכה רגשית. חברת אנתרופיק (Anthropic), מובילה בתחום בטיחות ה-AI ומודלי שפה גדולים, פרסמה לאחרונה עדכון מפורט על מנגנוני ההגנה והאסטרטגיות שנועדו להבטיח את בטיחות ורווחת המשתמשים של Claude. הצוות הייעודי לבטיחות באנתרופיק מוביל את המאמצים להבטיח ש-Claude יטפל בשיחות רגישות באמפתיה, בכנות לגבי מגבלותיו כבינה מלאכותית, ובהתחשבות בבריאות הנפשית של המשתמשים.
חיזוק ההגנות: תמיכה נפשית ומאבק ב"סלחנות"
הגנה מפני סיכונים נפשיים ב-Claude
הדו"ח מתמקד בשני תחומי מפתח: התמודדות Claude עם שיחות הנוגעות לאובדנות ופגיעה עצמית, והפחתת "סלחנות" (sycophancy) – נטייה של מודלים מסוימים לומר למשתמשים את מה שהם רוצים לשמוע, במקום את האמת או מידע מועיל. אנתרופיק מבהירה כי Claude אינו תחליף לייעוץ מקצועי או טיפול רפואי. במצבים של שיח אובדני, Claude מונחה להגיב בזהירות ובחמלה, תוך הפניית המשתמשים לתמיכה אנושית מקצועית, כמו קווי מצוקה ומומחי בריאות הנפש, באמצעות שילוב של אימון מודלים קפדני ופריסת תכונות מגן במוצר.
מנגנוני ההגנה של Claude
אנתרופיק עושה זאת באמצעות System Prompt מנחה, ותהליך אימון מודלים מבוסס למידת חיזוק (reinforcement learning), שבו המודל מתוגמל על תגובות מתאימות. בנוסף, מנגנוני הגנה חדשים כוללים "מסווג" (classifier) מבוסס AI המזהה שיחות הדורשות תמיכה מקצועית ומציג באנר הפניות לגורמי סיוע חיצוניים, בשיתוף פעולה עם ThroughLine ו-International Association for Suicide Prevention (IASP). מדדי ביצועים חדשים מראים כי מודלי הדור האחרון – Claude Opus 4.5, Sonnet 4.5 ו-Haiku 4.5 – מגיבים באופן הולם לכ-98.6%-99.3% מהבקשות המסוכנות בשיחות בודדות, וכן רשמו שיפור דרמטי בשיחות רב-שלביות ובמבחני לחץ, עם ביצועים שהגיעו עד 91% במודל Opus 4.5.


