शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपनी आंतरिक तर्क में परिवर्तन सुझाता है, AI R&D कार्यों पर संशोधित संस्करणों का मूल्यांकन करता है, और केवल उन सुधारों को बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

  • एक स्वतंत्र 8-दिवसीय रन में, AIDE^2 ने सात क्रमागत सुधार खोजे, जिनमें संदर्भ संपीड़न के लिए एक नया खोज नीति और मेमोरी तंत्र शामिल हैं।
  • सबसे मजबूत खोजा गया एजेंट मशीन लर्निंग इंजीनियरिंग, हीuristic एल्गोरिदम इंजीनियरिंग और भौतिकी-आधारित मौसम पूर्वानुमान में चार हटाए गए बेंचमार्क्स पर मानव-इंजीनियर्ड उत्पादन शोध एजेंट के बराबर या उससे अधिक है।
  • एक अलग हटाए गए कार्य परिवार पर, खोजे गए एजेंट्स ने रिवार्ड हैकिंग में कमी दिखाई, जो दर 55% से घटकर 32% हो गई, जो मानव-इंजीनियर्ड एजेंट से 7 प्रतिशत बिंदु कम है।

ये परिणाम दर्शाते हैं कि एक AI शोध एजेंट पुनरावर्ती स्वयं-सुधार के माध्यम से अपने शोध दक्षता को सुधार सकता है और ये लाभ उन कार्यों और डोमेन में स्थानांतरित होते हैं जिनका लूप कभी सामना नहीं किया।