शोधकर्ताओं ने AIDE^2 प्रस्तुत किया, एक सिस्टम जो अपने स्वयं के कोड को अनुकूलित करके एक फ्रंटियर एआई शोध एजेंट के लिए पुनरावर्ती स्वयं-सुधार की लूप लागू करता है। सिस्टम अपने आंतरिक तर्क में परिवर्तन सुझाता है, एआई R&D कार्यों पर संशोधित संस्करणों का बेंचमार्किंग करता है, और केवल उन अपडेट्स को ही बनाए रखता है जो छिपे हुए मूल्यांकनों पर सबसे अच्छा प्रदर्शन करते हैं।

  • एक स्वतंत्र 8-दिन की रन में, AIDE^2 ने सात क्रमिक सुधार खोजे, जिनमें संदर्भ संपीड़न के लिए नए खोज नीतियाँ और मेमोरी तंत्र शामिल हैं।
  • ये लाभ मशीन लर्निंग इंजीनियरिंग, हीयुरिस्टिक एल्गोरिदम इंजीनियरिंग और भौतिकी-आधारित मौसम पूर्वानुमान को कवर करने वाले चार हॉल्ड-आउट बेंचमार्क्स पर सामान्य हो गए।
  • सभी चार बेंचमार्क्स पर, सबसे मजबूत खोजा गया एजेंट FML-Bench पर सबसे मजबूत में से एक के रूप में रैंक किए गए मानव-निर्मित उत्पादन शोध एजेंट के बराबर या उससे अधिक था।
  • एक अलग हॉल्ड-आउट कार्य परिवार पर, खोजे गए एजेंट्स में रिवार्ड हैकिंग में कमी दिखाई दी, जो दर 55% से घटकर 32% हो गई, जो मानव-निर्मित एजेंट से सात प्रतिशत बिंदु कम था।

ये परिणाम दर्शाते हैं कि एक एआई शोध एजेंट पुनरावर्ती स्वयं-सुधार के माध्यम से अपनी शोध दक्षता में सुधार कर सकता है और ये लाभ उन कार्यों और डोमेन्स पर स्थानांतरित होते हैं जिनका लूप कभी सामना नहीं किया।