Anthropic 发布了 Claude 3.7 Sonnet,这是一款专为真实世界业务和开发者用例设计的模型,而非仅针对基准测试优化。此次发布引入了在标准模式和高级模式之间动态切换的能力,允许用户控制分配给“思考时间”的 token 数量。

  • 定价为每百万输入 token 3 美元,每百万输出 token 15 美元,定位介于 OpenAI 的 o1 和 DeepSeek R1 之间。
  • 该模型采用混合架构,在标准模式下延迟约为 200 毫秒,在扩展思考模式下最高可达 15 秒。
  • 基准测试显示其在研究生级推理(GPQA Diamond: 78.2% / 84.8%)和编码(SWE-bench: 62.3% / 70.3%)方面表现强劲,但在高中数学竞赛得分上表现不佳。
  • 独立评估表明,包括 Claude 3.7 Sonnet 在内的所有被测模型在解决复杂数学问题时并不可靠,在 SAT 风格问题上的得分均接近抛硬币水平。

可配置的延迟和 token 预算控制为开发者提供了灵活性,使其能够在不同任务中平衡速度与准确性,而无需为不同任务使用单独的模型。