قامت أبحاث الذكاء الاصطناعي في جوجل، بالتعاون مع جامعة كارولاينا الشمالية في تشابل هيل، وستانفورد، وجامعة واشنطن في سانت لويس، بإطلاق RRSI (التحسين الذاتي المتكرر المنتظم) كمصدر مفتوح. يتيح هذا الإطار لوكيل نموذج لغوي كبير إعادة كتابة حيازته الخاصة — بما في ذلك المطالبات، والأدوات، والذاكرة، وتدفق التحكم، والوكلاء الفرعيين — دون تغيير أوزان النموذج.
- يعالج RRSI الإفراط في التخصيص عن طريق تقييد حلقة التحسين باستخدام منتظمين مثل ميزانية التعديل المتلاشية، وتسجيل الائتمان الواعي بالأدلة، ونقد التسرب الذي يرفض المنطق الخاص بالمعايير.
- يستخدم النظام قاعدة أرضية وقواعد تكلفة معدلة بالضوضاء لضمان أن المكاسب حقيقية وفعالة، مع تقليم المكونات التي تتوقف عن إنتاج قيمة.
- على Terminal-Bench 2.1، ارتفعت الدرجات من 74.2% إلى 80.2%, بينما تحسن SWE-bench Verified من 82.0% إلى 83.8% على التقسيمات المحجوبة.
- شهدت معايير التوزيع خارج العينة مكاسب قدرها +4.7 نقطة على JobBench، و+3.5 على GDPval، و+3.7 على APEX-Agents.
- يقلل الإطار من استخدام رموز السياسة بنسبة تقارب 30-36% مقارنة بطرق التطور غير المنتظمة.
يرى المؤلفون أن هذا مهم لأنه يمكّن وكلاء الذكاء الاصطناعي من تحسين هيكلهم التشغيلي الذاتي مع الحفاظ على التعميم عبر المهام التي لم يتم تحسينها صراحةً ضدها.