OpenAI声称其具备高级推理能力和Python工具访问权限的o3-mini模型在FrontierMath基准测试中取得了32%的成绩。然而,Epoch的官方独立评估报告称,该成绩显著较低,仅为11%。

  • Epoch构建了该基准测试,并且有更准确的评分动机。
  • OpenAI报告其在最难问题层级上的得分为28%,这与其总分过于接近,令人怀疑。
  • Epoch发布了关于其测试基础设施和数据的详细信息,而OpenAI发布的内容很少。
  • 差异可能源于OpenAI使用了更强大的内部框架、更多的测试时计算量,或不同的问题子集(180题对比290题)。

结果的差异凸显了在大型语言模型基准测试中透明评估方法和独立验证的重要性。