
הנדסה4 במרץ 2025
קלוד 3.5 Sonnet קובע רף חדש ב-SWE-bench Verified
מודל ה-LLM החדש של אנתרופיק (Anthropic), Claude 3.5 Sonnet, מציג קפיצת מדרגה משמעותית בביצועים על מדד SWE-bench Verified, ומגיע ל-49%, מעל מודלי החזית המובילים. הכתבה בוחנת את היכולות המתקדמות של המודל בתחום הנדסת התוכנה ודיוק יצירת הקוד, ומסבירה את שיטות ההערכה הטכניות ששימשו לבחינת הסוכן. היא מדגימה כיצד שילוב מודל ה-AI עם פיגומים (scaffolding) מינימליסטי ויעיל, מאפשר למפתחים למצות את הפוטנציאל המרבי שלו למשימות קידוד סוכני.
קרא עוד