Anthropic ने Claude Opus 5 मॉडल लॉन्च किया है, जिसने कोडिंग और सामान्य क्षमता मेट्रिक्स पर इसके प्रदर्शन की जांच और फ्रंटियर मॉडल मूल्यांकन के बारे में फिर से बहस को बढ़ावा दिया।

  • Epoch AI ने रिपोर्ट किया कि Claude Opus 5 ECI 159 प्राप्त करता है, जो Fable 5 के 161 से थोड़ा कम है, जबकि सॉफ्टवेयर इंजीनियरिंग बेंचमार्क पर SWE-ECI 161 के साथ Fable 5 के बराबर है।
  • उपयोगकर्ताओं ने ECI स्कोर को व्यावहारिक सुधारों को कम आंकने के लिए आलोचना की, यह नोट करते हुए कि यह Opus 4.8 से केवल एक अंक बेहतर है, भले ही गुणात्मक लाभ महसूस किए गए हैं।
  • एक मूल्यांकन असामान्यता का उल्लेख किया गया जहाँ Opus 5 ने FrontierCode पर मध्यम प्रयास पर उच्च प्रयास की तुलना में बेहतर स्कोर प्राप्त किया, जो अतिरिक्त इनफरेंस-टाइम कंप्यूट से गैर-एकदिशीय लाभ का सुझाव देता है।
  • Microsoft के CTO Kevin Scott ने "best-of-n" सैंपलिंग का उपयोग करके Fable के खिलाफ सीधा जीत की रिपोर्ट दी, जबकि Nous Portal ने 20% छूट के साथ मॉडल तक पहुंच की घोषणा की।

इस लॉन्च ने एजेंटिक कार्यों जैसे ब्राउजर ऑटोमेशन में उपयोगकर्ता-रिपोर्ट किए गए प्रदर्शन और समग्र बेंचमार्क स्कोर के बीच तनाव को उजागर किया।