2026年7月15日から8月2日に開催されたICML 2026 Open Reproductionsチャレンジは、AIエージェントと人間の監視を用いて採択された論文の再現に取り組むことでコミュニティを巻き込んだ。この取り組みは、これまでにない規模の機械学習カンファレンスに対するオープンな主張ごとの監査となった。

  • 調査対象の論文のうち、51%が少なくとも1つの主張を独立して検証され、23%が少なくとも1つの主張が虚偽または争われていることが判明した。
  • 496本の論文に少なくとも1つの虚偽または争われている主張が含まれており、そのうち49本はすべての主張が虚偽であり、242本ではチーム間で相反する結論が下された。
  • 確認されたエラーには、ページングアルゴリズムの堅牢性項が誤って増加していたこと、ステップ224以降で定理が成立しなくなったこと、およびKLダイバージェンス損失に間違ったコードが使用されていたことが含まれる。
  • このチャレンジは、人間の関与を含むワークフローが、微妙なエラーの検出や知覚的品質の評価において、純粋なエージェントの実行よりも信頼性が高いことを浮き彫りにした。

主催者は、エージェントが再現作業をスケールできる一方で、人間がエージェントを誘導し、前提を検証し、本質的に人間の評価を行うために不可欠であると結論づけている。