Un estudio que audita seis pruebas de física ampliamente utilizadas encuentra que las puntuaciones bajas reportadas para los modelos de lenguaje de vanguardia se deben en gran medida a errores en la evaluación y no a deficiencias del modelo. Los expertos revisaron los enunciados de los problemas, las soluciones de referencia y las respuestas de los modelos, distinguiendo errores genuinos de equivocaciones del evaluador, referencias incorrectas y preguntas ambiguas.
- El mean@4 de GPT-5.6-Sol en HLE-Physics aumentó de 47,3% a 78,7% tras la corrección.
- Su puntuación en CMT-Benchmark aumentó de 61,0% a 87,2% tras la revisión por expertos.
- El modelo logró un pass@4 corregido de 94,4% en los 54 desafíos CritPt retenidos.
- Las puntuaciones en UGPhysics, PRISM-Physics y PHYBench también aumentaron sustancialmente después de la auditoría.
Los hallazgos indican que las pruebas actuales subestiman considerablemente la capacidad de los modelos de vanguardia para resolver problemas de física bien planteados, destacando la necesidad de evaluaciones más exigentes y validadas por expertos.