Epoch AI发布的独立基准测试结果显示,OpenAI公开推出的o3模型在FrontierMath数据集上的得分约为10%,远低于该公司在12月发布时最初强调的超过25%的分数。
- Epoch AI使用更新版的FrontierMath基准测试对已发布的o3模型进行评估,发现其得分约为10%。
- OpenAI最初声称的超过25%的得分是在比公开版本更强大的内部框架上,使用激进的测试时计算设置实现的。
- ARC Prize Foundation确认,公开的o3针对聊天和产品用途进行了调整,其计算层级低于他们测试的预览版本。
- OpenAI技术团队表示,生产模型优化目标是成本效益和速度,而非最高基准性能。
这一差异凸显了验证第三方基准测试的重要性,并澄清已发布的模型优先考虑实际效用而非峰值学术分数。