Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.

  • El equipo corrigió cada defecto confirmable para crear SciCode-Verified, añadiendo especificaciones necesarias y reparando la lógica de calificación.
  • La reevaluación de doce instantáneas de modelos de vanguardia en el benchmark corregido mostró que la precisión por subproblema aumentó del 45–60% al 84–98%.
  • La precisión del problema principal aumentó significativamente del 9–27% al 69–92%, demostrando que los modelos de última generación son mucho más competentes de lo que se sugería anteriormente.

Los autores publican SciCode-Verified con su historial completo de auditoría como el estándar público corregido, estableciendo que el cuello de botella anterior era la calidad del instrumento de evaluación.