Os autores identificam que a estagnação das pontuações no benchmark SciCode decorre de defeitos significativos no instrumento de avaliação, e não de limitações na capacidade dos modelos. Uma auditoria realizada por especialistas de domínio em 65 problemas de teste revelou 263 defeitos, dos quais 192 causavam a rejeição incorreta de soluções corretas devido a problemas como respostas padrão não reproduzíveis e tolerâncias excessivamente restritivas.
- A equipe corrigiu todos os defeitos confirmáveis para criar o SciCode-Verified, adicionando especificações necessárias e reparando a lógica de avaliação.
- A reavaliação de doze instantâneos de modelos de ponta no benchmark corrigido mostrou que a precisão por subproblema aumentou de 45–60% para 84–98%.
- A precisão em problemas principais aumentou significativamente de 9–27% para 69–92%, demonstrando que os modelos de última geração são muito mais proficientes do que anteriormente sugerido.
Os autores lançam o SciCode-Verified com seu histórico completo de auditoria como o padrão público corrigido, estabelecendo que o gargalo anterior era a qualidade do instrumento de avaliação.