Anthropic 发布了新一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,在编码、高级推理和 AI 智能体工作流方面树立了新的基准。这些混合模型既提供近乎即时的响应,也支持用于深度推理的“扩展思考”模式,并具备并行工具执行和改进记忆等新能力。

  • Claude Opus 4 在 SWE-bench(72.5%)和 Terminal-bench(43.2%)上领先,并在长达数小时的持续任务中保持性能。
  • Claude Sonnet 4 在 SWE-bench 上达到 72.7% 的最优水平,作为 Sonnet 3.7 的升级版本,提供了能力与效率的最佳平衡。
  • 两款模型均在测试阶段支持带工具使用的扩展思考,使其能够在推理和行动(如网络搜索)之间交替。
  • Claude Code 现已全面可用,原生集成 VS Code 和 JetBrains,并提供用于构建自定义智能体的新 SDK。
  • 新的 API 功能包括代码执行工具、MCP 连接器、Files API 以及长达一小时的提示缓存。

这些模型旨在通过推动编码和研究领域的边界,并借助增强的可控性减少捷径行为,将前沿性能带入日常用例,从而推进 AI 战略。