Une étude auditant six benchmarks de physique largement utilisés constate que les scores faibles signalés pour les modèles de langage de pointe sont principalement dus à des erreurs de benchmarking plutôt qu'à des lacunes des modèles. Des experts ont examiné les énoncés de problèmes, les solutions de référence et les réponses des modèles, distinguant les erreurs réelles des erreurs de notation, des références incorrectes et des questions ambiguës.
- La moyenne@4 de GPT-5.6-Sol sur HLE-Physics est passée de 47,3 % à 78,7 % après correction.
- Son score sur CMT-Benchmark a augmenté de 61,0 % à 87,2 % suite à l'examen par des experts.
- Le modèle a obtenu un pass@4 corrigé de 94,4 % sur les 54 défis CritPt conservés.
- Les scores sur UGPhysics, PRISM-Physics et PHYBench ont également considérablement augmenté après l'audit.
Les résultats indiquent que les benchmarks actuels sous-estiment considérablement la capacité des modèles de pointe à résoudre des problèmes de physique bien posés, soulignant le besoin d'évaluations plus exigeantes et validées par des experts.