xAI 委托 Epoch AI 评估 Grok 4 的数学能力,通过定性调查和基准数据,将其优势与劣势与其他模型进行比较。

  • Grok 4 在解决中等难度的高中数学竞赛题方面处于最先进水平,通过逐步推导得出解法,在基准测试中得分达到 85%,而此前 Gemini 2.5 Pro 和 o4-mini 在此项上持平。
  • 该模型在处理具有挑战性的高中竞赛中的证明类问题时接近最先进水平,但在一般性证明方面仍有显著的提升空间。
  • 专业数学家认为 Grok 4 可能是目前可用于数学文献搜索的最佳模型。
  • 评估指出,Grok 4 与其他大语言模型一样,倾向于重视底层计算而非空间直觉或创造力,并且只能发现部分而非全部自身错误。
  • Epoch AI 批评 xAI 发布的博文中的性能图表具有误导性,特别指出在旨在手工完成的竞赛中不当纳入了 Python 工具,以及内部 USAMO 评分缺乏透明度。

这项分析有助于在 headline numbers 出现之前识别新能力的迹象,并建议为未来模型开发增加有用的基准测试。