광범위하게 사용되는 여섯 가지 물리 벤치마크를 감사한 연구에 따르면, 최첨단 언어 모델의 보고된 낮은 점수는 모델의 결함보다는 벤치마킹 오류로 인해 주로 발생했다. 전문가들은 문제 진술, 참조 솔루션 및 모델 응답을 검토하여 실제 오류와 채점자의 실수, 잘못된 참조, 모호한 질문을 구분했다.
- GPT-5.6-Sol의 HLE-Physics에서 mean@4는 보정 후 47.3%에서 78.7%로 상승했다.
- 전문가 검토 후 CMT-Benchmark에서의 점수는 61.0%에서 87.2%로 증가했다.
- 모델은 보존된 54개의 CritPt 과제에서 보정된 pass@4 94.4%를 달성했다.
- UGPhysics, PRISM-Physics, PHYBench의 점수도 감사 후 크게 상승했다.
이 결과는 현재 벤치마크가 잘 정의된 물리 문제를 해결하는 최첨단 모델의 능력을 상당히 과소평가하고 있음을 나타내며, 더 엄격하고 전문가 검증이 이루어진 평가의 필요성을 강조한다.