ICML 2026 Open Reproductions 挑战赛于 2026 年 7 月 15 日至 8 月 2 日举行,动员社区利用 AI 代理和人工监督复现已接收的论文。该工作产生了迄今为止规模最大、针对机器学习会议逐条声明的公开审计。

  • 在已审查的论文中,51% 至少有一项声明得到独立验证,而 23% 至少有一项声明被证伪或受到质疑。
  • 496 篇论文至少包含一项被证伪或受质疑的声明,其中包括 49 篇所有声明均被证伪的论文,以及 242 篇各团队得出相反结论的论文。
  • 确认的错误包括:分页算法的鲁棒性项增长不正确、某定理在第 224 步之后失效、代码使用了错误的 KL 散度损失。
  • 该挑战赛凸显了,在捕捉细微错误和评估感知质量方面,人在回路的工作流比纯代理执行更可靠。

组织者得出结论:虽然代理可以扩展复现工作的规模,但人类在引导代理、质疑假设以及执行不可简化的评估方面仍然不可或缺。