Anthropicは、ベンチマークスコアと実務パフォーマンスについて大きな議論を巻き起こした新しいフロンティアモデルであるClaude Opus 5をリリースしました。Epoch AIによる独立した評価では、新モデルのEpoch Capabilities Index (ECI) が159、SWE-ECIが161であると報告されています。
- Claude Opus 5はECI 159を達成し、Fable 5のスコア161にわずかに及ばない。
- モデルはSWE-ECI 161で、ソフトウェアエンジニアリングベンチマークにおいてFable 5と同等のパフォーマンスを示した。
- コミュニティからのフィードバックでは、ECIスコアがOpus 4.8(スコアはわずか1ポイント下)に対するOpus 5の実務上の改善を過小評価している可能性が示唆されている。
- 一部の評価者からは、FrontierCodeにおいて非単調なパフォーマンスが見られ、中程度の努力度入力が高努力度入力よりも優れていたことが指摘された。
- Nous Portalは、全モデルに20%割引を提供し、このモデルを公開した。
今回のリリースは、現在の評価指標の敏感性と、集計スコアと実際のコーディングエージェント能力とのギャップに関する継続的な議論を浮き彫りにしている。