15 जुलाई से 2 अगस्त 2026 तक आयोजित ICML 2026 ओपन रिप्रोडक्शंस चैलेंज ने एआई एजेंट्स और मानवीय निगरानी का उपयोग करके स्वीकृत पत्रों को पुनः उत्पन्न करने में समुदाय को शामिल किया। इस प्रयास के परिणामस्वरूप एक मशीन लर्निंग सम्मेलन का अब तक का सबसे बड़ा खुला, दावे-दर-दावा ऑडिट हुआ।
- अध्ययन किए गए पत्रों में से 51% में कम से कम एक दावा स्वतंत्र रूप से सत्यापित किया गया था, जबकि 23% में कम से कम एक दावा झूठा या विवादित था।
- 496 पत्रों में कम से कम एक झूठा या विवादित दावा था, जिसमें 49 ऐसे थे जहाँ सभी दावे झूठे थे और 242 ऐसे थे जहाँ टीमों ने विपरीत निर्णय दिए।
- पुष्टि की गई त्रुटियों में एक पेजिंग एल्गोरिदम की मजबूती पद का गलत ढंग से बढ़ना, चरण 224 के बाद एक प्रमेय का विफल होना, और गलत KL डायवर्जेंस नुकसान का उपयोग करने वाला कोड शामिल था।
- इस चुनौती ने यह उजागर किया कि सूक्ष्म त्रुटियों को पकड़ने और संवेदी गुणवत्ता का मूल्यांकन करने के लिए शुद्ध एजेंट निष्पादन की तुलना में मानव-इन-द-लूप कार्यप्रवाह अधिक विश्वसनीय थे।
आयोजकों का निष्कर्ष है कि हालांकि एजेंट्स पुनः उत्पादन प्रयासों को स्केल कर सकते हैं, लेकिन एजेंट्स को निर्देशित करने, धारणाओं पर सवाल उठाने और अपरिहार्य रूप से मानवीय मूल्यांकन करने के लिए मानव आवश्यक बने हुए हैं।