Google Cloud AI Research, en colaboración con UNC-Chapel Hill, Stanford y la Universidad de Washington en St. Louis, ha liberado como código abierto RRSI (Mejora Recursiva Regularizada). Este marco permite que un agente LLM reescriba su propio arnés —incluyendo prompts, herramientas, memoria, flujo de control y sub-agentes— sin cambiar los pesos del modelo.

  • RRSI aborda el sobreajuste al restringir el bucle de mejora con regularizadores como un presupuesto de edición atenuado, registro de crédito consciente de la evidencia y un crítico de filtración que rechaza la lógica específica del benchmark.
  • El sistema utiliza un suelo ajustado por ruido y una regla de costo para asegurar que las ganancias sean reales y eficientes, podando los componentes que dejan de producir valor.
  • En Terminal-Bench 2.1, las puntuaciones subieron del 74.2% al 80.2%, mientras que SWE-bench Verified mejoró del 82.0% al 83.8% en particiones no vistas.
  • Los benchmarks fuera de la distribución original mostraron ganancias de +4.7 puntos en JobBench, +3.5 en GDPval y +3.7 en APEX-Agents.
  • El marco reduce el uso de tokens de política aproximadamente un 30-36% en comparación con los métodos de evolución no regularizados.

Los autores consideran esto importante porque permite que los agentes de IA mejoren su propia estructura operativa mientras mantienen la generalización en tareas para las cuales no fueron optimizados explícitamente.