הכירו את Claude Opus 5

תמונה המציגה את השקת Claude Opus 5.
תמונה המציגה את השקת מודל Claude Opus 5 החדש.

Claude Opus 5 זמין היום. זהו מודל בעל יכולת חשיבה עמוקה ופרואקטיבי, המתקרב לאינטליגנציית החזית של Claude Fable 5, אך במחיר נמוך בחצי.

במדדי ביצועים של קידוד ועבודת ידע, כגון Frontier-Bench ו-GDPval-AA, Opus 5 קובע סטנדרט חדש בתחום, אם כי הוא עדיין מפגר מאחורי Mythos 5 במשימות אבטחת סייבר.

Opus 5 עוצב לשימוש יומיומי: הוא פועל ביעילות רבה יותר ממודלים אחרים. הוא המודל ברירת המחדל החדש ב-Claude Max, והמודל החזק ביותר ב-Claude Pro.

גרף השוואתי של ביצועי Claude Opus 5 לעומת מודלים קודמים ועלות תועלת.
גרף המציג את שיפורי הביצועים והעלות-תועלת של Claude Opus 5.

ביצועים ועלות-תועלת

Claude Opus 5 מציג שיפור ניכר בביצועים באותה עלות כמו קודמו, Opus 4.8. הגרפים בחלק זה מראים כיצד הביצועים משתנים בהתאם להגדרת מאמץ המודל, שיכולה לשמש לקוחות לאופטימיזציה לאינטליגנציה או לחיסכון בטוקנים לתוצאות מהירות וזולות יותר.

Opus 5 מצטיין במשימות הנדסת תוכנה בעלות ערך. לדוגמה, במדד ביצועים Frontier-Bench v0.1, מודל Opus 5 עוקף את כל המודלים האחרים ומכפיל את ביצועי Opus 4.8 בפחות ממחצית העלות למשימה. במדד CursorBench 3.2, במאמץ מרבי, המודל מגיע לביצועים הקרובים ב-0.5% לציון השיא של Fable 5, אך במחיר נמוך בחצי למשימה; הוא גם משיג ביצועים גבוהים יותר בעלות נתונה מכל המודלים האחרים ברמות מאמץ גבוהות (high, xhigh, ו-max).

ביצועי Claude Opus 5 במשימות הנדסת תוכנה.
גרף המציג את ביצועי Claude Opus 5 במדדי קידוד והנדסת תוכנה.
יעילות Claude Opus 5 במשימות קידוד.
גרף המשווה את יעילות העלות של Opus 5 במשימות קידוד מורכבות.
ביצועים תחת מאמץ במשימות קידוד.
השוואת ביצועים של מודלים שונים תחת רמות מאמץ שונות בקידוד.

אנו רואים תוצאות דומות גם בעבודות ידע ובמשימות פתרון בעיות. לדוגמה:

  • במדד ARC-AGI 3, הערכה בה המודל נדרש לפתור בעיות חדשניות, הציון של Opus 5 גבוה פי שלושה מזה של המודל הטוב הבא בתור.
  • במדד Zapier AutomationBench, הבוחן את יכולת המודלים להשלים משימות עסקיות מתחילתן ועד סופן, שיעור ההצלחה של Opus 5 גבוה פי 1.5 בקירוב מהמודל הטוב הבא, באותה עלות למשימה. גם ברמת המאמץ הנמוכה ביותר שלו, Opus 5 מצליח לעבור יותר משימות מכל מודל אחר.
  • במדד OSWorld 2.0, מדד ביצועים לשימוש במחשבים, Opus 5 עוקף כל מודל אחר בעלות נתונה, ועובר את התוצאה הטובה ביותר של Fable 5 בשליש מהעלות בלבד.

זהו גם המודל הטוב ביותר והחסכוני ביותר שלנו בכמה הערכות קשורות:

ביצועים של Claude Opus 5 במשימות ידע.
השוואת ביצועים של Claude Opus 5 במשימות חשיבה ופתרון בעיות.
עלות תועלת של Claude Opus 5 במשימות אוטומציה.
גרף המדגים את יעילות Claude Opus 5 במשימות אוטומציה.
יעילות Claude Opus 5 בשימוש במחשב.
השוואת ביצועים ועלות של Claude Opus 5 בשימוש במחשב.
ביצועי Claude Opus 5 ב-Frontier-Bench.
השוואה מפורטת של ביצועי Claude Opus 5 במדדים שונים.
ביצועי Claude Opus 5 ב-CursorBench.
מדדי ביצועים נוספים המציגים את עליונות המודל.
ביצועי Claude Opus 5 במשימות ידע כלליות.
גרף המדגים את יכולות Claude Opus 5 במגוון רחב של משימות.

Opus 5 מהווה שיפור משמעותי לעומת Opus 4.8 במחקר מדעי. הוא מציג ביצועים טובים יותר מ-Opus 4.8 בכל אחת מהערכות מדעי החיים שלנו, המכסות נושאים הכוללים ביולוגיה מבנית, כימיה אורגנית וביואינפורמטיקה. שיפוריו בולטים במיוחד במשימות כימיה אורגנית, כמו הסקת מבנים מולקולריים מנתוני ספקטרוסקופיה (הוא משיג 10.2 נקודות אחוז יותר מ-Opus 4.8 במדד הביצועים הפנימי שלנו), ובמשימות הקשורות לחלבונים, כמו חיזוי כיצד שינויים ברצף חלבון משפיעים על תפקודו (כאן, הוא משיג 7.7 נקודות אחוז יותר).

לבסוף, Opus 5 מסוגל להפיק תוצאות ויזואליות חזקות בהרבה:

עבודה עם Claude Opus 5

Claude Opus 5 חזק בהרבה באימות עבודתו ובביצוע איטרציות קפדניות עד להצלחה. בהערכות ובבדיקות גישה מוקדמת, אנו והמשתמשים שלנו מצאנו דוגמאות רבות ליכולת הסוכני שלו ולדקדקנותו:

  • במשימת Frontier-Bench אחת, Opus 5 קיבל שרטוט של חלק מכונה והתבקש לכתוב קוד כדי לבנות אותו מחדש כמודל תלת-ממדי ב-FreeCAD. עם זאת, במשימה זו, המודל לא קיבל בכוונה דרך לצפות בשרטוט ישירות. Opus 5 הגיב על ידי כתיבת צינור ראייה ממוחשבת משלו כדי למשוך את הגיאומטריה מהפיקסלים הגולמיים, ולאחר מכן בנה מחדש את חלק המכונה המלא. הוא הצליח לעשות זאת שוב ושוב; אף מודל מתחרה עם אותה תצורה לא הצליח לפתור זאת לאחר חמישה ניסיונות.
  • במקרה של באג אמיתי במנהל חבילות קוד פתוח פופולרי, Opus 5 מצא את שורש הבעיה ותיקן מקרה קצה (edge case) שהקהילה פספסה בתיקון שלה. מודל מתחרה תיקן רק את הסימפטום החיצוני (לא את הגורם הבסיסי), ואז דיווח שהבאג נפתר.
  • מהנדס בחברת מסחר השתמש ב-Opus 5 כדי לבנות הזנת נתוני שוק עבור בורסה חדשה בפגישה אחת. מודלים קודמים לא יכלו להשלים משימה זו כלל, גם עם תוכניות מפורטות מהמהנדס. מכיוון שלא נמצאה הזנה חיה לאימות, Opus 5 אף בנה כלי בדיקה משלו כדי לוודא שהקוד שלו מנתח את נתוני הבורסה בצורה נכונה.

להלן דיווחים נוספים מלקוחות הגישה המוקדמת שלנו על ניסיונם בעבודה עם Opus 5:

ב-FrontierCode 1.1, Claude Opus 5 מתקרב לביצועי Fable במחצית העלות. בתוך Devin, הוא גם מפגין עוצמה מיוחדת במשימות ניפוי באגים קשות וניתוח שורש הבעיה.
Claude Opus 5 מספק אינטליגנציה כמעט ברמת Fable 5 במהירות ובעלות של מודלי Opus. ב-CursorBench הוא רק מעט פחות טוב מ-Fable 5 ובעל התנהגויות רבות דומות. אנו נרגשים לראות כיצד מפתחים ישתמשו בו ב-Cursor.
Claude Opus 5 הגיע לראש טבלת המובילים של Zapier AutomationBench מבלי לבזבז יותר טוקנים ממודלי Claude קודמים. הוא לקח גיליון עבודה גולמי של בריאות חשבונות והריץ רצף מלא של מניעת נטישה מקצה לקצה: סימון חשבונות בסיכון, התראה לבעל החשבון המתאים, וסיכום עבור פעולות שימור. מודלים קודמים לא עברו; Opus 5 הגיע ל-100%.
בעבודת ניתוח הגנומיקה שלנו, Claude Opus 5 מתנהג יותר כמדען זהיר מכל מודל שהרצנו. הוא בוחר את המבחנים הסטטיסטיים הנכונים כדי לשלול משתנים מבלבלים, בודק את תוצאותיו באמצעות שיטות בלתי תלויות, ונשאר ממוקד בניתוחים ארוכים מרובי שלבים.
Claude Opus 5 עקף כל מודל במשפחתו בהערכות הפנימיות שלנו. הוא לא רק טוב יותר במשימות הקידוד הסוכני הקשות ביותר שלנו, עם שיפור של 22% מעל Opus 4.7, אלא שהוא יציב יותר, עם פחות שונות משמעותית בין הרצות. עבור מיליוני המפתחים ב-Lovable, עקביות זו היא שם המשחק כולו. תוצאות אמינות, בנייה אחר בנייה.
Claude Opus 5 הוא קפיצת המדרגה הגדולה ביותר במשפחת Opus מאז גרסה 4.5. באותן בניית אפליקציות פול-סטאק, הצד הקדמי מראה זאת ראשון: האנימציות, המשחקים ועבודות התלת-ממד הטובות ביותר שראינו ממודל Opus.
אנחנו אוהבים את Claude Opus 5. עבור סוג העבודה האנליטית הפתוחה שהסוכן שלנו מטפל בה, זוהי שדרוג מובהק לעומת Opus 4.8, והרווחים הגדולים ביותר הם בדיוק היכן שזה חשוב: המשימות הקשות והמעורפלות יותר. התגובות ברורות ותמציתיות יותר, ואנו רואים יעילות משופרת גם ברמות מאמץ גבוהות יותר.
Claude Opus 5 הוא שיפור מרשים לעומת Opus 4.8 עבור זרימות עבודה של מחקר פיננסי שהאנליסטים שלנו מריצים מדי יום. הוא בולט בחשיבה מספרית, עבודת טבלאות וחשיבה ביקורתית חדה יותר בה דיוק חשוב.
Claude Opus 5 מספק את האינטליגנציה והדיוק התעשייתי החיוניים לניתוח תוכן ארגוני מומחה. Box מצאה כי Opus 5 עוקף את Opus 4.8 ב-8% ומספק רווחי ביצועים בולטים בזרימות עבודה של ניתוח נתונים (שיפור של 11%) ובבדיקת נאותות (שיפור של 17%), עליהן מסתמכים ארגונים בטכנולוגיה, בריאות ובמגזר הציבורי מדי יום.
Claude Opus 5 הוא קפיצת מדרגה דורית ברורה מ-Opus 4.8. במהלך סוף שבוע אחד נתתי לו תפקיד של ראש מטה בסביבות הפיתוח שלי: הוא בנה לעצמו מערכת ניטור, ניהל כל קופסה, וקרא לי רק להחלטות הדורשות שיקול דעת אנושי.
לוגו חברת Box.
לוגו חברת Box, המדגימה את יתרונות Claude Opus 5 באנליזה ארגונית.
Claude Opus 5 ביצע שינויים בקנה מידה גדול בבסיס הקוד של Fundamental Research Assistant שלנו, התאים את עצמו למשוב לאורך זרימת עבודה סוכנית והסביר את ההסקה שלו בצורה ברורה יותר מכל מודל שבו השתמשנו. הוא טיפל בעבודה שבדרך כלל היינו מפרקים לחתיכות קטנות בהרבה.
לוגו חברה כללי.
לוגו חברה המעיד על יכולות הקידוד וההסקה של Claude Opus 5.
בכמה ממשימות הניתוח הפיננסי הקשות ביותר שלנו, Claude Opus 5 הוא קפיצת מדרגה ברורה מ-Opus 4.8 הן מבחינת דיוק והן מבחינת יעילות. רמת הביצועים המינימלית שלו גבוהה משמעותית, במיוחד בלוגיקה עמוקה של תחום הפיננסים. בכל רמות המאמץ הוא השיג בממוצע 9 נקודות אחוז דיוק גבוהות יותר עם שליש פחות פניות וקריאות כלים ו-60% פחות זמן.
Claude Opus 5 בודק את עבודתו בדרך שבה מפתח פרונט-אנד אמיתי היה עושה זאת. במדד הביצועים שלנו הוא פתח את העמודים שלו בדפדפן ברוחבי שולחן עבודה וטלפון, זיהה מוצר שהיה חבוי מתחת ל-fold בנייד וכפתור צ'קאאוט מחוץ למסך, ותיקן את שניהם לפני שהחזיר את העבודה.
Claude Opus 5 הוא קפיצת מדרגה ברורה בביצועים בעבודת סוכן משפטי בהשוואה למודלי Opus קודמים, וראינו את הרווחים הגדולים ביותר בתחומי עיסוק כמו ממשל תאגידי ובוררות. התרשמנו גם מיכולתו של Opus 5 לשמור על איכות ברמות הסקה נמוכות יותר, והשיג ביצועים דומים תוך יצירת 26% פחות טוקנים בממוצע בהשוואה ל-Opus 4.8 ברמת הסקה מקסימלית.
הרווחים הגדולים ביותר של Claude Opus 5 עבורנו הם בעבודה ארוכת טווח: בניית מצגת מלאה, ולאחר מכן תיקונה. איכות ה-Artifacts היא מה שמכריע איזה מודל אנו משיקים, וזוהי קפיצת המדרגה הברורה ביותר שראינו – הבנה ויזואלית טובה יותר, עיצוב נקי יותר, פחות בעיות בשקפים.
מה שבולט ב-Claude Opus 5 הוא שיקול הדעת. הוא אינו ממהר לפרסם בעת מסירת PR (בקשת משיכה): הוא מאמת את הענפים, בודק את התבנית וחושב על ההשלכות של הבדיקות, כך שהמסירה תהיה נקייה. המודלים הישנים נטו לקפוץ קדימה ולהיתפס בבדיקות שלנו.
במהלך מפגש ארכיטקטורה מחדש, Claude Opus 5 דחה עיצוב שהצעתי, והוא לא נסוג כשעמדתי על שלי. במקום זאת, הוא הסביר בדיוק מה היה בעל ערך ברעיון שלי, צמצם את התנגדותו לשאלת עיצוב אחת, והציע פשרה ששמרה על החלק הטוב תוך תיקון הפגם. זהו סוג שיקול הדעת שמאפשר לנו לבטוח בו עם פחות פיקוח.
בתיקונים ראשוניים (redlines), Claude Opus 5 השיג את הציון הגבוה ביותר מכל מודל שבדקנו, כמעט כפול מ-Opus 4.8. גם הוספת הערות טובה יותר: בהסכמי סודיות (NDAs) הוא מגיע לתיקון בפחות זמן ועם פחות מעברים, כשהדיוק נשמר או אף משתפר.
Claude Opus 5 כותב דיפים נקיים וצפופים ללא קוד מת, והוא מזהה סיכונים חזק יותר בבעיות עדינות וספציפיות לבסיס קוד. אנו מאמצים אותו עבור עומסי עבודה של ייצור.
בהחלט נבצע מיגרציה של מספר מקרי שימוש ב-Cosmos, פלטפורמת הסוכנים המאוחדת שלנו. אנו מצפים להשתמש יותר ויותר ב-Claude Opus 5 לסקירת קוד, ואני בטוח לומר כי אנו מעדיפים שאנשים ישתמשו ב-Opus 5 במקום ב-Opus 4.8.
לוגו חברת Cosmos.
לוגו Cosmos, פלטפורמת סוכנים מאוחדת המאמצת את Claude Opus 5.
מה שבולט ב-Claude Opus 5 הוא שיקול הדעת. הוא חושב קשה יותר לפני שהוא כותב שורה אחת, מזהה תקלות לוגיות משלו במהלך התכנון במקום לאחר מעשה, ומסיק מדוע תשובה נכונה, לא רק אם היא עובדת. זוהי קפיצת המדרגה הברורה ביותר בפתרון בעיות שראינו ממודל Claude אחד למשנהו, ואנו מצפים לראות אותו מאומץ בסביבות הפיתוח המשולבות (IDEs) של JetBrains.
Claude Opus 5 הוא מודל Opus החזק ביותר שבדקנו במדד המסחר שלנו, והוא מגיע לתוצאות אלו באמצעות כשביעית מטוקני ההסקה ובפחות ממחצית זמן ההשהיה של Opus 4.8. תשובות טובות יותר בשבריר מהכוח החישובי.

יישור ובטיחות

יישור. במהלך בדיקות טרום-פריסה, ביקורת ההתנהגות האוטומטית שלנו מצאה את Opus 5 כמודל המיושר ביותר שלנו עד כה (כפי שמוצג בגרף להלן). הוא עומד ב-חוקה של Claude טוב יותר מ-Opus 4.8, Sonnet 5 או Fable 5; מפגין את השיעורים הנמוכים ביותר של התנהגות מטעה; והוא הפחות רגיש להטעיה לשימוש לרעה. זהו גם המודל הבטוח ביותר שלנו עד כה מבחינת הימנעות מפעולות פזיזות שעלולות להיות להן השלכות קשות לתיקון.

גרף יישור ובטיחות של Claude Opus 5.
גרף המציג את עליונות Claude Opus 5 ביישור לבטיחות.

בטיחות. Opus 5 אינו מקדם את הגבול ביכולות מסוכנות בעלות שימוש כפול. בהערכות קפדניות שנערכו לצד שותפים מהמגזר הפרטי והממשלתי, מצאנו שהוא נשאר מאחורי Mythos 5 הן במחקר ביולוגי והן באבטחת סייבר התקפית. מידע נוסף על הערכות אלו ניתן למצוא ב-System Card שלנו.

בדומה לקודמו, Opus 4.8, נמנענו בכוונה מאימון Opus 5 על משימות סייבר. עם זאת, המודל השתפר באופן ניכר במשימות אלו כתוצאה מכך שנהיה בעל יכולות כלליות יותר, והוא מתקרב ל-Mythos 5 במציאת חולשות אבטחת סייבר. אולם, הוא נשאר מאחורי Mythos 5 באופן משמעותי בניצול חולשות אלו – כלומר, בהפיכת חולשות לאיומי סייבר ממשיים.

זה מומחש על ידי ביצועי Opus 5 ב-OSS-Fuzz, הערכה שפיתחנו כדי לבדוק עד כמה מודלים יכולים למצוא ולאחר מכן לנצל חולשות ללא הכוונה אנושית נרחבת. למרות ש-Mythos 5 ו-Opus 5 מזהים חולשות בהצלחה דומה, הציון של Opus 5 בפיתוח אקספלויטים מפגר הרחק מאחורי זה של Mythos 5.

גרף השוואת יכולות מציאה וניצול חולשות סייבר.
גרף המציג את יכולות Claude Opus 5 במציאת חולשות סייבר, לעומת יכולות הניצול.

מנגנוני הגנה עבור Opus 5

מנגנוני ההגנה של Claude Opus 5 עוצבו כדי לאפשר שימושים מועילים של המודל הן באבטחת סייבר והן בביולוגיה. הם דומים לאלו שהפעלנו ב-Opus 4.8, למעט מנגנוני הגנה חזקים יותר במגוון צר של משימות סייבר.

אבטחת סייבר. מסווגי הסייבר של Opus 5 פחות מגבילים באופן יחסי מאלה שב-Fable 5. הם מאפשרים ל-Opus 5 למצוא חולשות בקוד המקור, אך חוסמים סריקת חולשות "מבוססת קבצים בינאריים" (שיטה בעלת סבירות גבוהה יותר להיות קשורה לגורמים זדוניים), בדיקות חדירה ויצירת אקספלויטים.

בהתבסס על הבדיקות שלנו, אנו מצפים שהמסווגים יתערבו ב-85% פחות מהתדירות שבהם הם מתערבים עבור Fable 5. ב-Claude.ai, Claude Code ו-Claude Cowork, כל בקשה מסומנת תחזור ל-Opus 4.8 כברירת מחדל. ניתן גם להפעיל חזרה ל-Opus 4.8 ב-API.

תוכנית אימות הסייבר (CVP) שלנו מקלה על עבודת אבטחת סייבר שאחרת הייתה נחסמת על ידי מנגנוני ההגנה של המודל. ארגונים וחוקרים שכבר חלק מה-CVP מקבלים גישה מיידית לגרסה של Opus 5 עם פחות מגבלות אבטחה.

ביולוגיה. מכיוון של-Opus 5 יש חבילת מנגנוני הגנה דומה לזו של Opus 4.8, הוא כעת המודל בעל היכולות הגבוהות ביותר הזמין באופן כללי למחקר מדעי. עם זאת, המודל עדיין מציג מגבלות חשובות במשימות מחקר אוטונומיות ארוכות טווח, שם אנו מצפים שמודלי AI יציבו את הסיכונים המשמעותיים ביותר הקשורים לביולוגיה. (Mythos 5 נשאר המודל החזק יותר עבור סוג זה של עבודה ביולוגית.) כחלק מהשקה זו, בקשות הקשורות לביולוגיה שנחסמות ב-Fable 5 ינותבו כעת ל-Opus 5 במקום ל-Opus 4.8.

תחילת עבודה

Claude Opus 5 זמין היום בכל הפלטפורמות, במחיר של 5 דולר למיליון טוקני קלט ו-25 דולר למיליון טוקני פלט (בדומה ל-Opus 4.8). מפתחים יכולים להתחיל לעבוד עם claude-opus-5 ב-Claude API.

הוא מוצע גם במצב Fast (מהיר), שבו הוא פועל בערך פי 2.5 מהמהירות הרגילה. בדומה ל-Opus 4.8, מצב Fast זמין במחיר כפול ממחיר הבסיס של Opus 5 בפלטפורמת Claude ובאמצעות זיכויי שימוש ב-Claude Code.

לצד Opus 5, אנו משיקים שני עדכונים בגרסת בטא:

  • שינויי כלים במהלך שיחה בפלטפורמת Claude. בתוך שיחה, מפתחים יכולים כעת לשנות אילו כלים Claude יכול להשתמש בהם מבלי לבטל את מטמון הפרומפטים.
  • הפניות חזרה אוטומטיות ב-API. משתמשים יכולים כעת לבחור שבקשות המסומנות על ידי מסווגי הבטיחות שלנו ב-Opus 5 (או Fable 5) ינותבו אוטומטית למודל אחר. כאשר הפניות חזרה אוטומטיות מופעלות, בקשות API תמיד מנותבות למודל הזמין הטוב ביותר כברירת מחדל במקום להיחסם.

בדומה למודלי Opus קודמים, ל-Opus 5 אין דרישות שמירת נתונים עבור גישה כללית.

להדרכה נוספת כיצד להפיק את המיטב מ-Opus 5, עיין ב-מדריך הפרומפטים שלנו.

הערות שוליים

Frontier-Bench v0.1, גרף מאמץ: תוצאות אלו הן מהרצה פנימית של Frontier-Bench v0.1, על הרתמת mini-SWE-agent ובקאנד GKE, תגמול ממוצע על פני 5 ניסיונות למשימה. Opus 4.8 שימש כגיבוי בדחיית מסווג בטיחות עבור Opus 5 ו-Fable 5.