ביצועים, שותפויות וזמינות
Claude Opus 4: קידוד וביצועים
Claude Opus 4 מתבסס על יכולות הקידוד ופתרון בעיות מורכבות שלו, ומוביל במדדי ביצועים כמו SWE-bench עם 72.5% וב-Terminal-bench עם 43.2%. יכולות הזיכרון שלו שופרו באופן דרמטי, והוא מסוגל ליצור ולתחזק 'קבצי זיכרון' לאחסון מידע מפתח, מה שמשפר את המודעות למשימות ארוכות טווח ואת קוהרנטיות סוכני ה-AI. Claude Sonnet 4 מציג אף הוא שיפורים משמעותיים ביכולות הקידוד, עם 72.7% ב-SWE-bench, ומציע איזון אופטימלי בין ביצועים ליעילות עבור מגוון רחב של תרחישים.
חברות מובילות כבר מדווחות על ההשפעה:
"Claude Sonnet 4 מרקיע שחקים בתרחישים סוכנים (agentic scenarios) ויוצג כמודל המניע את סוכן הקידוד החדש ב-GitHub Copilot," כך נמסר מ-GitHub.
שני המודלים זמינים כמודלים היברידיים המציעים תגובות מיידיות או "חשיבה מורחבת" לעיבוד מעמיק יותר, וניתנים לפריסה דרך ה-API של אנתרופיק, Amazon Bedrock, ו-Google Cloud's Vertex AI. המחירים נשארים עקביים עם המודלים הקודמים. אנתרופיק מדגישה כי המודלים החדשים עברו בדיקות והערכות נרחבות כדי למזער סיכונים ולמקסם בטיחות, כולל יישום אמצעי הגנה מתקדמים ברמת AI Safety Level 3 (ASL-3).