O Desafio de Reproduções Abertas do ICML 2026, realizado de 15 de julho a 2 de agosto de 2026, envolveu a comunidade na reprodução de artigos aceitos usando agentes de IA e supervisão humana. O esforço resultou na maior auditoria aberta, afirmação por afirmação, de uma conferência de aprendizado de máquina até o momento.

  • Dos artigos examinados, 51% tinham pelo menos uma afirmação verificada independentemente, enquanto 23% tinham pelo menos uma afirmação falsificada ou contestada.
  • 496 artigos tinham pelo menos uma afirmação falsificada ou contestada, incluindo 49 nos quais todas as afirmações foram falsificadas e 242 nos quais as equipes chegaram a veredictos opostos.
  • Erros confirmados incluíam o termo de robustez de um algoritmo de paginação crescendo incorretamente, um teorema falhando após o passo 224 e código usando a perda de divergência KL errada.
  • O desafio destacou que fluxos de trabalho com humano no loop foram mais confiáveis do que a execução pura de agentes para detectar erros sutis e avaliar a qualidade perceptual.

Os organizadores concluem que, embora os agentes possam escalar os esforços de reprodução, os humanos permanecem essenciais para orientar os agentes, questionar suposições e realizar avaliações irreduzivelmente humanas.