Claude Opus 5 在各方面均显著强于 Claude Opus 4.8,在代理式编码、计算机使用和长周期知识工作方面提升最大。它在多个第三方基准测试中创下新的最先进水平,并在许多评估中与 Claude Fable 5 和 Claude Mythos 5 相当或领先。
- Opus 5 被定位为在实际任务中与 Fable 5 相当或更优,同时速度更快且成本减半。
- 该模型刻意避免在网络安全相关任务上进行训练,因此缺乏 Mythos 级模型所具备的复杂网络攻击能力。
- 在病毒学评估中,Opus 5 略优于 Mythos 5,因为这些任务涉及单步操作而非需要大规模推理。
- ArtificialAnalysis 将 Opus 5 评为新高 61,Anthropic ECI 点估计值为 162.1,使其处于 Mythos 趋势线上。
文章指出,保持 Opus 规模并避免网络安全训练可为防御者争取时间,以获取更优工具,其分类器触发频率比 Fable 低 85%。