OpenAI为独立的数学基准测试FrontierMath提供了资金,同时受到保密协议的约束,该协议阻止Epoch AI在OpenAI宣布其o3模型创下纪录的性能之前披露这一关系。该基准测试由60多位数学家开发,用于测试复杂的推理能力,而OpenAI的o3在其中取得了25.2%的成功率。

  • FrontierMath于2024年11月推出,旨在评估高级数学问题解决能力。
  • Epoch AI签署了一项协议,禁止在12月20日o3发布前披露OpenAI的资金支持。
  • 基准测试问题由60多位顶尖数学家团队创建,他们并不知道资金来源。
  • OpenAI获得了“大部分但非全部”FrontierMath数据的访问权限,尽管口头协议禁止将这些材料用于模型训练。
  • Epoch AI承认缺乏透明度是一个错误,并承诺在未来的合作中提供更清晰的资金来源信息。

这一情况凸显了AI基准测试的复杂性以及透明度的重要性,尤其是数学推理是语言模型的主要弱点之一。