一项对比分析评估了 Claude 3.7 Sonnet、Claude 3.5 Sonnet、OpenAI o3-mini、DeepSeek R1 和 Grok 3 Beta 在数学、编码和推理基准测试中的能力。

  • 在 GPQA Diamond 上,Grok 3 Beta 通过扩展推理达到 84.6%,而 Claude 3.7 Sonnet 在同一模式下达到 84.8%。
  • 在 AIME 数学竞赛中,Grok 3 Beta 以 93.3% 领先,而 Claude 3.7 Sonnet 得分为 61.3%,但在 Math500 上表现优异,达到 96.2%。
  • OpenAI o3-mini 在 AIME(高达 83.3%)和 GPQA Diamond(高计算模式下为 78%)上展现出强劲性能,同时注重成本效益。
  • DeepSeek R1 在 AIME 上表现具有竞争力(79.8%),但在研究生级别的推理任务中表现出波动性。

该研究旨在通过突出这些领先模型在成本、上下文窗口大小和可靠性方面的权衡,帮助用户做出明智的决策。