Google Cloud AI Research, en collaboration avec UNC-Chapel Hill, Stanford et l'Université Washington à Saint-Louis, a open-sourcé RRSI (Regularized Recursive Self-Improvement). Ce cadre permet à un agent LLM de réécrire son propre harnais — y compris les prompts, les outils, la mémoire, le flux de contrôle et les sous-agents — sans modifier les poids du modèle.
- RRSI traite le surajustement en contraignant la boucle d'amélioration avec des régularisateurs tels qu'un budget d'édition décroissant, un journalisation de crédit sensible aux preuves et un critique de fuite qui rejette la logique spécifique au benchmark.
- Le système utilise un plancher ajusté par du bruit et une règle de coût pour garantir que les gains sont réels et efficaces, en élaguant les composants qui ne produisent plus de valeur.
- Sur Terminal-Bench 2.1, les scores sont passés de 74,2 % à 80,2 %, tandis que SWE-bench Verified est passé de 82,0 % à 83,8 % sur des splits non vus.
- Les benchmarks hors distribution ont enregistré des gains de +4,7 points sur JobBench, +3,5 sur GDPval et +3,7 sur APEX-Agents.
- Le cadre réduit l'utilisation des tokens de politique d'environ 30 à 36 % par rapport aux méthodes d'évolution non régularisées.
Les auteurs considèrent cela important car il permet aux agents IA d'améliorer leur propre structure opérationnelle tout en maintenant la généralisation sur des tâches pour lesquelles ils n'ont pas été explicitement optimisés.