Челлендж ICML 2026 Open Reproductions, проходивший с 15 июля по 2 августа 2026 года, вовлек сообщество в воспроизведение принятых статей с использованием ИИ-агентов и человеческого контроля. Эта работа стала крупнейшим открытым аудитом утверждений по отдельности на конференции по машинному обучению на сегодняшний день.

  • Из рассмотренных статей 51% имели хотя бы одно утверждение, независимо подтверждённое как верное, тогда как 23% содержали хотя бы одно опровергнутое или оспоренное утверждение.
  • У 496 статей было найдено хотя бы одно опровергнутое или оспоренное утверждение, включая 49 случаев, когда все утверждения были опровергнуты, и 242 случая, когда команды пришли к противоположным выводам.
  • Подтверждённые ошибки включали неверный рост члена устойчивости в алгоритме страничной организации памяти, несостоятельность теоремы после шага 224 и использование кодом неправильной функции потерь KL-дивергенции.
  • Челлендж показал, что рабочие процессы с участием человека оказались более надёжными, чем чисто агентное выполнение, для выявления тонких ошибок и оценки перцептивного качества.

Организаторы приходят к выводу, что, хотя агенты могут масштабировать усилия по воспроизведению, люди остаются необходимыми для управления агентами, подвержения сомнению допущений и выполнения неотъемлемо человеческой оценки.