Anthropicはコーディング能力や汎用能力の指標におけるそのパフォーマンスへの注目を集め、フロンティアモデルの評価に関する議論を再燃させる形でClaude Opus 5モデルをリリースした。

  • Epoch AIによると、Claude Opus 5はECIで159を達成し、Fable 5の161にわずかに及ばないものの、ソフトウェアエンジニアリングのベンチマークではSWE-ECIで161となりFable 5と同等のパフォーマンスを示した。
  • ユーザーはECIスコアが実用的な改善を過小評価していると批判し、定性的な向上が感じられるにもかかわらずOpus 4.8よりわずか1ポイントしか優れていないと指摘した。
  • Opus 5が中程度の努力レベルでFrontierCodeにおいて高い努力レベルよりも良いスコアを出したという評価の異常が指摘され、追加の推論時計算資源から非単調な改善が生じた可能性を示唆している。
  • Microsoft CTOのKevin Scottは「best-of-n」サンプリングを用いてFableとの直接対決で勝利を収めたと報告し、Nous Portalは20%割引でこのモデルへのアクセスを提供すると発表した。

今回のリリースは、ブラウザ自動化などのエージェントタスクにおけるユーザー報告のパフォーマンスと集計ベンチマークスコアの間の緊張関係を浮き彫りにした。