El desafío de reproducciones abiertas de ICML 2026, celebrado del 15 de julio al 2 de agosto de 2026, involucró a la comunidad en la reproducción de artículos aceptados utilizando agentes de IA y supervisión humana. El esfuerzo resultó en la auditoría abierta más grande, afirmación por afirmación, de una conferencia de aprendizaje automático hasta la fecha.
- De los artículos examinados, el 51% tenía al menos una afirmación verificada independientemente, mientras que el 23% tenía al menos una afirmación falsificada o cuestionada.
- 496 artículos tenían al menos una afirmación falsificada o cuestionada, incluyendo 49 donde todas las afirmaciones fueron falsificadas y 242 donde los equipos llegaron a veredictos opuestos.
- Los errores confirmados incluyeron un término de robustez de un algoritmo de paginación que crecía incorrectamente, un teorema que fallaba después del paso 224 y código que usaba la pérdida de divergencia KL incorrecta.
- El desafío destacó que los flujos de trabajo con humanos en el bucle eran más confiables que la ejecución pura de agentes para detectar errores sutiles y evaluar la calidad perceptual.
Los organizadores concluyen que, aunque los agentes pueden escalar los esfuerzos de reproducción, los humanos siguen siendo esenciales para dirigir a los agentes, cuestionar supuestos y realizar evaluaciones irreductiblemente humanas.