2026년 7월 15일부터 8월 2일까지 진행된 ICML 2026 오픈 리프로덕션 챌린지는 AI 에이전트와 인간의 감독을 통해 채택된 논문의 재현에 커뮤니티를 참여시켰습니다. 이 노력은 지금까지 이루어진 머신러닝 컨퍼런스 중 가장 방대한 공개 주장별 감사로 이어졌습니다.
- 검토된 논문 중 51%가 적어도 하나의 주장을 독립적으로 검증받았으며, 23%가 적어도 하나의 주장이 허위이거나 논쟁의 대상이 되었습니다.
- 496편의 논문이 적어도 하나의 허위 또는 논쟁적 주장을 포함하고 있었는데, 이 중 모든 주장이 허위인 경우가 49편, 팀 간 상반된 결론이 나온 경우가 242편이었습니다.
- 확인된 오류에는 페이지링 알고리즘의 강건성 항이 잘못 증가한 경우, 224단계 이후에 성립하지 않는 정리, 그리고 잘못된 KL 발산 손실을 사용한 코드가 포함되었습니다.
- 이 챌린지는 미세한 오류를 포착하고 지각적 품질을 평가하는 데 순수 에이전트 실행보다 인간 참여 워크플로우가 더 신뢰할 수 있음을 강조했습니다.
주최 측은 에이전트가 재현 노력을 확장할 수는 있지만, 인간이 여전히 에이전트 유도, 가정 검토, 그리고 본질적으로 인간적인 평가 수행에 필수적이라고 결론지었습니다.