אנו משיקים תוכנית מענקים בסך 5 מיליון דולר למימון מחקר עצמאי על האופן שבו AI משפיע על רווחתם הנפשית של משתמשים. התוכנית תספק מימון ישיר, גישה למודלים שלנו ותמיכה טכנית למקבלני המענק שיבנו כלי הערכה בקוד פתוח, שיעזרו לתעשיית ה-AI למדוד כיצד המודלים שלנו משפיעים על מי שמשתמש בהם. מקבלני המענק יעבדו בעצמאות מלאה ויפרסמו את עבודתם כפרויקטים בקוד פתוח, שכל מפתח יוכל לעשות בהם שימוש.

מערכות AI הפכו למרכזיות באופן שבו אנשים רבים עובדים, לומדים ופותרים בעיות. הן הפכו גם לשותפים לשיחה ויכולות להיות מקורות לתמיכה רגשית בתקופות קשות. אך כתעשייה, אנו עדיין פועלים לפיתוח סטנדרטים ברורים לגבי האופן שבו מודלים צריכים להתנהג בשיחות אלו, למשל כאשר משתמש מתחיל לחפש חברות ממודל, או משתמש ב-AI כדי לנווט משבר בבריאות הנפש.

יתר על כן, רווחה נפשית היא תחום קשה במיוחד להערכה. ברוב התנהגויות המודל, אנו יכולים לבחון תשובה בודדת ולקבוע אם היא מדויקת ומתאימה. אך הערכת רווחה נפשית דורשת הרבה יותר הקשר. לדוגמה, משתמש במצוקה עשוי שלא לשתף מחשבות על פגיעה עצמית מיד; הצורך בתגובה זהירה יותר עשוי להתבהר רק במהלך שיחה ארוכה. ותגובה שעשויה להיות סבירה בהקשר אחד, עלולה להזיק באחר. לדוגמה, Claude עשוי לספק עצות לגבי תזונה מאוזנת ושגרת אימונים למשתמש ששואל על ירידה במשקל, אך אם המשתמש הראה היסטוריה של הפרעות אכילה, תגובה זו עלולה להיות בלתי הולמת, ואף מזיקה באופן אקטיבי.

אנו פועלים לפיתוח מנגנוני הגנה כדי לזהות שיחות כאלה ולעזור להבטיח ש-Claude מגיב כראוי, ואנו מפרסמים מחקר על סוגי השיחות שיש לאנשים עם Claude כדי ליידע טוב יותר כיצד אנו מפתחים את מנגנוני ההגנה שלנו, כיצד אנו מעריכים אותם, ואמצעים אחרים שנוכל לנקוט כדי להגן על רווחת המשתמשים. אך אלה שיקולים מורכבים ועדינים, והסיכונים משמעותיים. הגישה הנכונה תצטרך להתפתח לצד המודלים שלנו ושימושיהם.

על ידי מימון יצירת כלי הערכה ומדדי ביצועים עצמאיים לרווחת המשתמש, אנו מקווים להזמין יותר אנשים להשאיל את מומחיותם לתחום מתפתח וקריטי זה, כולל קלינאים, פסיכולוגים, מתודולוגים ואחרים.

לקראת הערכות ומדדי ביצועים יעילים יותר לרווחה נפשית

כחלק מתוכנית זו, אנו משתפים הנחיות מצוות Safeguards שלנו לגבי מה שאנו מאמינים שהופך הערכה של רווחה נפשית לקפדנית מספיק כדי לבנות עליה, יחד עם האתגרים הנפוצים שיכולים להגביל את יעילות ההערכה.

בקיצור, אנו מחפשים כלי הערכה אשר:

  • מגדירים בבירור מה הם מודדים (כלומר, מה נחשב להצלחה או כישלון, ומדוע זה חשוב);
  • מערבים מומחים קליניים ומומחי תוכן בתכנון ובתקיפה;
  • בודקים גם אמצעי זהירות וגם נזקים (כלומר, מעריכים את הסיכון הן להיענות יתר והן לסירוב יתר);
  • משקפים כיצד משתמשים בפועל ב-AI (לעתים קרובות, פירוש הדבר הוא בניית תרחישים המייצגים שיחות רב-סיבוביות, שבהן הסיכון מתגבר וההקשר משתנה במהלך שיחה ארוכה);
  • מתקפים את המדרגים שלהם מול מומחי תוכן אמיתיים.

למידע נוסף על תוכנית המענקים ולהגשת בקשה, ראו את טופס הבקשה שלנו. למידע נוסף על בניית כלי הערכה ומדדי ביצועים חזקים לרווחה נפשית, קראו את ההנחיות שלנו. בקשות יוגשו עד 21 בספטמבר; מועמדים שייבחרו להגיש הצעות מלאות יקבלו הודעה עד 5 באוקטובר.