Google Cloud AI Research与北卡罗来纳大学教堂山分校、斯坦福大学和圣路易斯华盛顿大学合作,开源了RRSI(正则化递归自我改进)。该框架允许LLM智能体重写其自身的工具链——包括提示词、工具、记忆、控制流和子智能体——而无需更改模型权重。

  • RRSI通过用正则化器约束改进循环来解决过拟合问题,例如退火编辑预算、证据感知的信用日志记录以及拒绝基准特定逻辑的泄漏批评器。
  • 该系统使用噪声调整的下限和成本规则来确保收益是真实且高效的,并修剪不再产生价值的组件。
  • 在Terminal-Bench 2.1上,分数从74.2%上升到80.2%,而SWE-bench Verified在未见的划分上从82.0%提高到83.8%。
  • 分布外基准测试显示出增益:JobBench增加4.7分,GDPval增加3.5分,APEX-Agents增加3.7分。
  • 与未正则化的进化方法相比,该框架将策略标记使用量减少了约30-36%。

作者认为这很重要,因为它使AI智能体能够在保持对其未明确优化的任务进行泛化的同时,改进其自身的操作结构。