一项对六个广泛使用的物理基准测试进行的审计研究发现,前沿语言模型报告的较低得分主要源于基准测试错误,而非模型缺陷。专家审查了问题陈述、参考解决方案和模型响应,区分了真实错误、评分器失误、不正确的参考以及模糊的问题。

  • 经修正后,GPT-5.6-Sol 在 HLE-Physics 上的 mean@4 从 47.3% 上升至 78.7%。
  • 经专家审查后,其在 CMT-Benchmark 上的得分从 61.0% 上升至 87.2%。
  • 该模型在保留的 54 个 CritPt 挑战中实现了 94.4% 的修正 pass@4。
  • 审计后,UGPhysics、PRISM-Physics 和 PHYBench 上的得分也大幅上升。

研究结果表明,当前基准测试严重低估了前沿模型解决定义良好的物理问题的能力,凸显了对更严格、经专家验证的评估的需求。