أطلقت أنثروبيك نموذج كلود أوبوس 5، مما أدى إلى تدقيق أدائه في مقاييس البرمجة والقدرات العامة، بالإضافة إلى تجديد النقاش حول تقييم النماذج المتقدمة.

  • أفادت Epoch AI بأن كلود أوبوس 5 يحقق درجة ECI تبلغ 159، وهي أقل قليلاً من درجة فابل 5 البالغة 161، بينما تتطابق مع فابل 5 في درجة SWE-ECI البالغة 161 على مقاييس هندسة البرمجيات.
  • انتقد المستخدمون درجة ECI باعتبارها تقلل من شأن التحسينات العملية، مشيرين إلى أنها أفضل بنقطة واحدة فقط من أوبوس 4.8 رغم المكاسب النوعية المدركة.
  • لوحظت عدم انتظام في التقييم حيث حصل أوبوس 5 على درجات أفضل في FrontierCode عند الجهد المتوسط مقارنة بالجهد الأعلى، مما يشير إلى مكاسب غير رتيبة من الحوسبة الإضافية أثناء الاستدلال.
  • أفاد الرئيس التنفيذي للتقنية في مايكروسوفت كيفن سكوت بفوز مباشر ضد فابل باستخدام عيّنة "best-of-n"، بينما أعلن Nous Portal عن الوصول إلى النموذج بخصم بنسبة 20%.

يبرز الإطلاق التوتر بين درجات المقاييس المجمعة والأداء المبلغ عنه من قبل المستخدمين في المهام الوكيلية مثل أتمتة المتصفح.