저자들은 SciCode 벤치마크에서의 점수 정체 현상이 모델 능력의 한계가 아니라 평가 도구의 중대한 결함에서 비롯된 것임을 확인했습니다. 65개의 테스트 문제에 대한 도메인 전문가 감사 결과 263개의 결함이 발견되었으며, 이 중 192개는 재현 불가능한 정답과 지나치게 엄격한 허용 오차 등의 문제로 인해 올바른 솔루션이 잘못 거부되는 원인이 되었습니다.

  • 팀은 확인 가능한 모든 결함을 수정하여 SciCode-Verified를 생성하고 필요한 명세를 추가하며 채점 논리를 수리했습니다.
  • 수정된 벤치마크에서 12개의 최첨단 모델 스냅샷을 재평가한 결과, 하위 문제 정확도가 45–60%에서 84–98%로 상승했습니다.
  • 주요 문제 정확도는 9–27%에서 69–92%로 크게 증가하여, 최신 모델이 이전에 제시된 것보다 훨씬 더 숙련되어 있음을 보여주었습니다.

저자들은 수정된 공개 표준으로 완전한 감사 기록과 함께 SciCode-Verified를 출시했으며, 이전의 병목 현상이 평가 도구의 품질에 있었다는 것을 입증했습니다.