Le défi Open Reproductions d'ICML 2026, organisé du 15 juillet au 2 août 2026, a mobilisé la communauté pour reproduire les articles acceptés à l'aide d'agents IA et de supervision humaine. Cet effort a abouti à la plus vaste vérification ouverte, affirmation par affirmation, d'une conférence de machine learning à ce jour.

  • Parmi les articles examinés, 51 % présentaient au moins une affirmation indépendamment vérifiée, tandis que 23 % comportaient au moins une affirmation falsifiée ou contestée.
  • 496 articles avaient au moins une affirmation falsifiée ou contestée, dont 49 où toutes les affirmations étaient falsifiées et 242 où les équipes ont rendu des verdicts opposés.
  • Les erreurs confirmées comprenaient un terme de robustesse d'un algorithme de pagination qui augmentait incorrectement, un théorème échouant après l'étape 224, et du code utilisant la mauvaise perte de divergence KL.
  • Le défi a mis en évidence que les flux de travail avec humain dans la boucle étaient plus fiables que l'exécution pure par agents pour détecter des erreurs subtiles et évaluer la qualité perceptive.

Les organisateurs concluent que, bien que les agents puissent mettre à l'échelle les efforts de reproduction, les humains restent essentiels pour orienter les agents, remettre en question les hypothèses et effectuer des évaluations irréductiblement humaines.