Anthropic ने Claude Opus 5 जारी किया है, एक नया फ्रंटियर मॉडल जिसने बेंचमार्क स्कोर और व्यावहारिक प्रदर्शन को लेकर महत्वपूर्ण चर्चा को जन्म दिया है। Epoch AI से स्वतंत्र मूल्यांकन ने नए मॉडल के लिए Epoch Capabilities Index (ECI) 159 और SWE-ECI 161 की रिपोर्ट की है।

  • Claude Opus 5 ने ECI 159 हासिल किया, जो Fable 5 के स्कोर 161 से थोड़ा नीचे है।
  • मॉडल सॉफ्टवेयर इंजीनियरिंग बेंचमार्क्स पर Fable 5 के बराबर है, जिसका SWE-ECI 161 है।
  • समुदाय की प्रतिक्रिया संकेत देती है कि ECI स्कोर Opus 4.8 के सापेक्ष Opus 5 के व्यावहारिक सुधारों को कम आंक रहा है, जिसका स्कोर केवल एक अंक कम था।
  • कुछ मूल्यांकनकर्ताओं ने FrontierCode पर गैर-एकसमान प्रदर्शन नोट किया, जहाँ मध्यम-प्रयास इनपुट उच्च-प्रयास वाले इनपुट्स से बेहतर थे।
  • Nous Portal ने सभी मॉडल्स पर 20% छूट के साथ मॉडल उपलब्ध करा दिया है।

लॉन्च वर्तमान मूल्यांकन मापदंडों की संवेदनशीलता और एग्रीगेट स्कोर के बीच के अंतर पर चल रही बहस को उजागर करता है, साथ ही वास्तविक-दुनिया के कोडिंग एजेंट क्षमताओं के साथ।