Para penulis mengidentifikasi bahwa skor yang stagnan pada benchmark SciCode berasal dari cacat signifikan dalam instrumen evaluasi, bukan dari keterbatasan kemampuan model. Audit oleh pakar domain terhadap 65 soal pengujian menemukan 263 cacat, dengan 192 di antaranya menyebabkan solusi yang benar ditolak secara keliru karena masalah seperti jawaban acuan yang tidak dapat direproduksi dan toleransi yang terlalu ketat.

  • Tim memperbaiki setiap cacat yang dapat dikonfirmasi untuk membuat SciCode-Verified, menambahkan spesifikasi yang diperlukan dan memperbaiki logika penilaian.
  • Penilaian ulang terhadap dua belas snapshot model terdepan pada benchmark yang telah diperbaiki menunjukkan akurasi subsoal meningkat dari 45–60% menjadi 84–98%.
  • Akurasi soal utama meningkat secara signifikan dari 9–27% menjadi 69–92%, menunjukkan bahwa model mutakhir jauh lebih mahir daripada yang sebelumnya disimpulkan.

Para penulis merilis SciCode-Verified beserta jejak audit lengkapnya sebagai standar publik yang telah diperbaiki, menegaskan bahwa hambatan sebelumnya adalah kualitas instrumen evaluasi.