広く使用されている6つの物理ベンチマークを監査した研究によると、最先端言語モデルの低いスコアは主にモデルの欠陥ではなくベンチマークの実施誤りに起因していることが明らかになった。専門家は問題文、正解解答、モデルの回答を検討し、実際の誤答と採点者のミス、不正解の参考解答、曖昧な質問を区別した。
- HLE-PhysicsにおけるGPT-5.6-Solのmean@4は、修正後47.3%から78.7%に上昇した。
- 専門家によるレビュー後、CMT-Benchmarkでのスコアは61.0%から87.2%に増加した。
- モデルは、残された54件のCritPt課題において、修正後のpass@4で94.4%を達成した。
- UGPhysics、PRISM-Physics、PHYBenchのスコアも監査後に大幅に上昇した。
これらの知見は、現在のベンチマークが最先端モデルの適切に定義された物理問題を解く能力を大きく過小評価していることを示しており、より厳格で専門家による検証済みの評価の必要性を浮き彫りにしている。