Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA de vanguardia optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa las versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas actualizaciones que obtienen el mejor rendimiento en evaluaciones ocultas.

  • En una ejecución autónoma de 8 días, AIDE^2 descubrió siete mejoras sucesivas, incluidas nuevas políticas de búsqueda y mecanismos de memoria para la compresión del contexto.
  • Estas ganancias se generalizaron a cuatro conjuntos de datos de prueba reservados que abarcan la ingeniería de aprendizaje automático, la ingeniería de algoritmos heurísticos y la predicción meteorológica basada en física.
  • En los cuatro conjuntos de datos, el agente descubierto más fuerte igualó o superó a un agente de investigación de producción diseñado por humanos, clasificado entre los más fuertes en FML-Bench.
  • En una familia de tareas reservada separada, los agentes descubiertos mostraron una reducción en la explotación del sistema de recompensas, con la tasa disminuyendo del 55% al 32%, siete puntos porcentuales por debajo del agente diseñado por humanos.

Estos resultados demuestran que un agente de investigación con IA puede mejorar su propia eficiencia de investigación mediante la mejora recursiva y que estas ganancias se transfieren a tareas y dominios que el bucle nunca encontró.