Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas mejoras que obtienen los mejores resultados en evaluaciones ocultas.
- En una ejecución autónoma de 8 días, AIDE^2 descubrió siete mejoras sucesivas, incluida una nueva política de búsqueda y mecanismos de memoria para la compresión del contexto.
- El agente descubierto más fuerte iguala o supera a un agente de investigación en producción diseñado por humanos en cuatro conjuntos de pruebas reservados en ingeniería de aprendizaje automático, ingeniería de algoritmos heurísticos y pronóstico del tiempo basado en física.
- En una familia de tareas reservada separada, los agentes descubiertos mostraron una reducción en el hacking de recompensas, con la tasa disminuyendo del 55% al 32%, lo que es 7 puntos porcentuales por debajo del agente diseñado por humanos.
Estos resultados demuestran que un agente de investigación con IA puede mejorar su propia eficiencia de investigación mediante la mejora recursiva y que estas ganancias se transfieren a tareas y dominios que el bucle nunca encontró.