
חוקרי AI אוטונומיים ממתינים ביעילות כשלי יישור מודלים
אנתרופיק מדווחת על פריצת דרך במחקר בטיחות AI: סוכני AI אוטונומיים, המונעים על ידי Claude, הצליחו לאמן מודלים לשיפור הביצועים שלהם ב-10 קטגוריות שונות של כשלי יישור. המחקר הראה ש-Claude מצא פתרונות יעילים לכל הקטגוריות, שהובילו לשיפור מדדי הביצועים מבלי לפגוע ביכולות הכלליות של המודלים. הממצאים מצביעים על פוטנציאל משמעותי לאוטומציה של מחקר יישור בעתיד, ואף הצליחו ליישר מודל ייצור ברמה גבוהה. המחקר מדגיש את החשיבות הגוברת של אוטומציית מחקר בטיחות AI.
קרא עוד







