Anthropic推出了Claude Opus 5模型,其编码和通用能力指标的表现受到审视,同时前沿模型评估的争论再次升温。

  • Epoch AI报告称,Claude Opus 5的ECI得分为159,略低于Fable 5的161,但在软件工程基准测试中,其SWE-ECI得分与Fable 5持平,均为161。
  • 用户批评ECI分数低估了实际改进,指出尽管感知到定性提升,该分数仅比Opus 4.8高出1分。
  • 有人注意到一项评估异常:Opus 5在中等努力程度下的FrontierCode得分高于更高努力程度,这表明额外的推理时间计算量带来了非单调的收益。
  • 微软首席技术官Kevin Scott报告称,在使用“best-of-n”采样时,在与Fable的直接对比中获胜;Nous Portal则宣布以8折优惠开放该模型访问权限。

此次发布凸显了聚合基准测试分数与用户报告的浏览器自动化等智能体任务表现之间的张力。