Anthropic이 Claude Opus 5 모델을 출시하여 코딩 및 일반 능력 지표에서의 성능에 대한 감시와 프론티어 모델 평가에 관한 논쟁을 재점화시켰다.
- Epoch AI는 Claude Opus 5가 ECI 159를 달성했으며, 이는 Fable 5의 161보다 약간 낮지만 소프트웨어 엔지니어링 벤치마크에서 SWE-ECI 161로 Fable 5와 동등하다고 보고했다.
- 사용자들은 ECI 점수가 실제 개선 사항을 과소평가한다고 비판하며, 질적 향상에도 불구하고 Opus 4.8보다 단 한 점만 더 높다고 지적했다.
- Opus 5가 높은 노력 수준보다 중간 노력 수준에서 FrontierCode에서 더 높은 점수를 얻는 평가 이상 현상이 관찰되었으며, 이는 추가 추론 시간 컴퓨팅으로 인해 비단조적 개선이 발생했음을 시사한다.
- Microsoft CTO Kevin Scott은 "best-of-n" 샘플링을 통해 Fable와의 직접 대결에서 승리를 거뒀다고 보고했으며, Nous Portal은 20% 할인된 가격으로 모델에 대한 접근을 발표하였다.
이번 출시로 인해 집계 벤치마크 점수와 브라우저 자동화와 같은 에이전틱 작업에서의 사용자 보고 성능 간 긴장감이 부각되었다.