著者らは、SciCodeベンチマークでのスコアの頭打ちが、モデルの能力の限界ではなく評価ツールの重大な欠陥に起因することを特定した。ドメイン専門家の65件のテスト問題に対する監査により263件の欠陥が発見され、そのうち192件は再現不能な正解や過度に厳しい許容範囲などの問題により、正しい解答が誤って却下される原因となっていた。

  • チームは確認可能なすべての欠陥を修正し、SciCode-Verifiedを作成した。これには必要な仕様の追加と採点ロジックの修復が含まれる。
  • 修正されたベンチマークで12の最先端モデルのスナップショットを再評価した結果、サブ問題の精度が45–60%から84–98%に上昇した。
  • メイン問題の精度は9–27%から69–92%へと大幅に増加し、最先端モデルが以前示唆されていたよりもはるかに熟練していることを実証した。

著者らは、SciCode-Verifiedを完全な監査履歴とともに公開標準としてリリースし、以前のボトルネックが評価ツールの品質にあったことを確立した。