Anthropic 发布了 Claude Opus 5,这是一款前沿模型,引发了关于基准分数和实际性能的广泛讨论。Epoch AI 的独立评估报告显示,该新模型的 Epoch Capabilities Index (ECI) 为 159,SWE-ECI 为 161。

  • Claude Opus 5 的 ECI 为 159,略低于 Fable 5 的 161 分。
  • 在软件工程基准测试中,该模型与 Fable 5 持平,SWE-ECI 达到 161。
  • 社区反馈表明,ECI 分数低估了 Opus 5 相较于 Opus 4.8(仅低一分)的实际改进。
  • 部分评估者指出,在 FrontierCode 上存在非单调性能表现,中等努力输入的得分高于高努力输入。
  • Nous Portal 已提供该模型,并对所有模型给予 20% 折扣。

此次发布凸显了当前评估指标敏感性以及综合分数与现实世界编码智能体能力之间差距的持续争论。