Google Cloud AI Research совместно с UNC-Chapel Hill, Stanford и Washington University in St. Louis открыла исходный код RRSI (Regularized Recursive Self-Improvement). Эта фреймворк позволяет агенту LLM переписывать собственный хабресс — включая промпты, инструменты, память, управление потоком и субагентов — без изменения весов модели.
- RRSI решает проблему переобучения, ограничивая цикл улучшений с помощью регуляризаторов, таких как аннеалированный бюджет редактирования, логирование кредитов с учётом доказательств и критик утечки, отклоняющий логику, специфичную для бенчмарков.
- Система использует пороговое значение с корректировкой на шум и правило стоимости, чтобы гарантировать, что улучшения являются реальными и эффективными, отсекая компоненты, переставшие приносить пользу.
- На Terminal-Bench 2.1 результаты выросли с 74,2% до 80,2%, в то время как SWE-bench Verified улучшился с 82,0% до 83,8% на отложенных выборках.
- На бенчмарках вне распределения (out-of-distribution) наблюдались приросты: +4,7 балла на JobBench, +3,5 на GDPval и +3,7 на APEX-Agents.
- Фреймворк сокращает использование токенов политики примерно на 30-36% по сравнению с нерегуляризованными методами эволюции.
Авторы считают это важным, поскольку оно позволяет агентам ИИ улучшать свою собственную операционную структуру, сохраняя обобщающую способность для задач, против которых они не были явно оптимизированы.