Google Cloud AI Research, UNC-Chapel Hill, Stanford और Washington University in St. Louis के सहयोग से, RRSI (Regularized Recursive Self-Improvement) को ओपन-सोर्स कर चुका है। यह फ्रेमवर्क एक LLM एजेंट को मॉडल वेट्स को बदले बिना अपने हार्नेस—जिसमें प्रॉम्प्ट्स, टूल्स, मेमोरी, कंट्रोल फ्लो और सब-एजेंट शामिल हैं—को पुनः लिखने की अनुमति देता है।

  • RRSI एनील्ड एडिट बजट, इविडेंस-अवेयर क्रेडिट लॉगिंग और एक लीकेज क्रिटिक जैसे रेगुलाइज़र्स के साथ सुधार लूप को बांधकर ओवरफिटिंग से निपटता है, जो बेंचमार्क-विशिष्ट तर्क को अस्वीकार करता है।
  • प्रणाली लाभों को वास्तविक और कुशल बनाने के लिए एक नॉइज-एडजस्टेड फ्लोर और कॉस्ट नियम का उपयोग करती है, जो उन घटकों को हटा देती है जो अब मूल्य उत्पन्न करना बंद कर देते हैं।
  • Terminal-Bench 2.1 पर स्कोर 74.2% से बढ़कर 80.2% हो गए, जबकि SWE-bench Verified में हेल्ड-आउट स्प्लिट्स पर सुधार 82.0% से 83.8% तक हुआ।
  • आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क्स पर JobBench पर +4.7 अंक, GDPval पर +3.5 और APEX-Agents पर +3.7 के लाभ देखे गए।
  • इस फ्रेमवर्क ने अनरेगुलाइज़्ड इवोल्यूशन विधियों की तुलना में पॉलिसी टोकन उपयोग को लगभग 30-36% तक कम कर दिया है।

लेखकों का मानना है कि यह महत्वपूर्ण है क्योंकि यह AI एजेंट्स को अपनी कार्यप्रणाली संरचना को बेहतर बनाने की अनुमति देता है, उन कार्यों पर सामान्यीकरण बनाए रखते हुए जिनके लिए उन्हें स्पष्ट रूप से अनुकूलित नहीं किया गया था।