A Google Cloud AI Research, em colaboração com UNC-Chapel Hill, Stanford e Washington University in St. Louis, tornou open-source o RRSI (Regularized Recursive Self-Improvement). Este framework permite que um agente LLM reescreva seu próprio harness — incluindo prompts, ferramentas, memória, fluxo de controle e sub-agentes — sem alterar os pesos do modelo.

  • O RRSI aborda o overfitting ao restringir o loop de melhoria com regularizadores como um orçamento de edição annealed, registro de crédito consciente de evidências e um crítico de vazamento que rejeita lógica específica de benchmark.
  • O sistema utiliza um piso ajustado por ruído e uma regra de custo para garantir que os ganhos sejam reais e eficientes, podando componentes que deixam de produzir valor.
  • No Terminal-Bench 2.1, as pontuações subiram de 74,2% para 80,2%, enquanto o SWE-bench Verified melhorou de 82,0% para 83,8% em divisões não vistas.
  • Benchmarks out-of-distribution registraram ganhos de +4,7 pontos no JobBench, +3,5 no GDPval e +3,7 no APEX-Agents.
  • O framework reduz o uso de tokens de política em aproximadamente 30-36% em comparação com métodos de evolução não regularizados.

Os autores consideram isso importante porque permite que agentes de IA melhorem sua própria estrutura operacional enquanto mantêm a generalização em tarefas para as quais não foram explicitamente otimizados.