Les auteurs identifient que les scores en plateau sur le benchmark SciCode proviennent de défauts significatifs dans l'instrument d'évaluation plutôt que de limitations dans la capacité des modèles. Un audit par des experts du domaine de 65 problèmes de test a révélé 263 défauts, dont 192 entraînant le rejet incorrect de solutions correctes en raison de problèmes tels que des réponses de référence non reproductibles et des tolérances excessivement serrées.

  • L'équipe a corrigé chaque défaut vérifiable pour créer SciCode-Verified, ajoutant les spécifications nécessaires et réparant la logique de notation.
  • La réévaluation de douze instantanés de modèles de pointe sur le benchmark corrigé a montré une augmentation de la précision des sous-problèmes de 45–60 % à 84–98 %.
  • La précision des problèmes principaux a augmenté significativement de 9–27 % à 69–92 %, démontrant que les modèles de pointe sont bien plus compétents qu'auparavant suggéré.

Les auteurs publient SciCode-Verified avec son historique d'audit complet en tant que norme publique corrigée, établissant que le goulot d'étranglement précédent était la qualité de l'instrument d'évaluation.