Anthropic ने रिपोर्ट की है कि इसका अपग्रेडेड Claude 3.5 Sonnet मॉडल SWE-bench Verified बेंचमार्क पर 49% स्कोर हासिल करने में सफल रहा, जो पिछले 45% के स्टेट-ऑफ़-द-आर्ट स्कोर को पार करता है। लेख उस "एजेंट" सिस्टम का विवरण देता है जो मॉडल के आसपास विकसकों की प्रदर्शन अनुकूलन में मदद करने के लिए बनाया गया है।

  • SWE-bench Verified 500 समीक्षित सॉफ्टवेयर इंजीनियरिंग कार्यों का एक उपसमुच्चय है जो किसी मॉडल की Python रिपॉजिटरीज़ में GitHub मुद्दों को हल करने की क्षमता का परीक्षण करता है।
  • एजेंट डिज़ाइन दर्शन न्यूनतम सहायक ढांचे के साथ भाषा मॉडल को नियंत्रण देने को प्राथमिकता देता है, Bash और Edit टूल्स का उपयोग करते हुए।
  • गलतफहमी से बचने के लिए टूल विवरणों को परिष्कृत किया गया था, जैसे कि निर्देशिकाओं को स्थानांतरित करते समय त्रुटियों से बचने के लिए पूर्ण पथों की आवश्यकता।
  • सिस्टम तब तक नमूना लेता है जब तक कि मॉडल यह निर्णय नहीं ले लेता कि यह समाप्त हो गया है या 200k संदर्भ लंबाई को पार कर जाता है।

पोस्ट का उद्देश्य विकसकों को कोडिंग कार्यों पर Claude 3.5 Sonnet से सर्वोत्तम प्रदर्शन प्राप्त करने के लिए एजेंट आर्किटेक्चर को समझने में मदद करना है।