Anthropic은 벤치마크 점수와 실제 성능에 대해 상당한 논의를 촉발한 새로운 프런티어 모델인 Claude Opus 5를 출시했습니다. Epoch AI의 독립 평가에 따르면 새 모델의 Epoch Capabilities Index(ECI)는 159, SWE-ECI는 161입니다.

  • Claude Opus 5는 ECI 159를 달성했으며, 이는 Fable 5의 점수 161보다 약간 낮습니다.
  • 모델은 SWE-ECI 161로 소프트웨어 엔지니어링 벤치마크에서 Fable 5와 동률을 이룹니다.
  • 커뮤니티 피드백에 따르면 ECI 점수는 Opus 4.8(점수가 단 1점 차이) 대비 Opus 5의 실제 개선 사항을 과소평가하는 것으로 나타납니다.
  • 일부 평가자들은 FrontierCode에서 비단조적 성능이 관찰되었으며, 중등도 노력 입력이 고노력 입력보다 더 우수한 결과를 보였다고 지적했습니다.
  • Nous Portal은 모든 모델에 20% 할인을 적용하여 해당 모델을 출시했습니다.

이번 출시는 현재 평가 지표의 민감성과 집계 점수 및 실제 세계 코딩 에이전트 능력 간의 격차에 대한 지속적인 논쟁을 부각시켰습니다.