作者指出,SciCode 基准上分数停滞的原因在于评估工具存在重大缺陷,而非模型能力的局限。对 65 个测试问题的领域专家审计发现了 263 个缺陷,其中 192 个因不可复现的标准答案和过紧的容差等问题导致正确解法被错误拒绝。
- 团队修正了所有可确认的缺陷以创建 SciCode-Verified,并补充了必要的规范、修复了评分逻辑。
- 在修正后的基准上重新评估十二个前沿模型快照显示,子问题准确率从 45–60% 提升至 84–98%。
- 主问题准确率显著提高,从 9–27% 增至 69–92%,表明最先进模型的能力远超此前所暗示的水平。
作者发布了带有完整审计轨迹的 SciCode-Verified 作为修正后的公共标准,确立了此前的瓶颈在于评估工具的质量。