Pesquisadores apresentam o AIDE^2, um sistema que implementa um ciclo de autoaperfeiçoamento recursivo para um agente de pesquisa de IA de ponta, otimizando seu próprio código. O sistema propõe alterações em sua lógica interna, avalia versões modificadas em tarefas de P&D de IA e retém apenas as atualizações que obtêm o melhor desempenho em avaliações ocultas.
- Em uma execução autônoma de 8 dias, o AIDE^2 descobriu sete melhorias sucessivas, incluindo novas políticas de busca e mecanismos de memória para compressão de contexto.
- Esses ganhos generalizaram-se para quatro benchmarks mantidos fora do conjunto de treinamento, abrangendo engenharia de aprendizado de máquina, engenharia de algoritmos heurísticos e previsão meteorológica baseada em física.
- Em todos os quatro benchmarks, o agente descoberto mais forte igualou ou superou um agente de pesquisa de produção projetado por humanos, classificado entre os mais fortes no FML-Bench.
- Em uma família de tarefas mantida fora do conjunto de treinamento separada, os agentes descobertos exibiram redução na exploração de recompensas (reward hacking), com a taxa caindo de 55% para 32%, sete pontos percentuais abaixo do agente projetado por humanos.
Esses resultados demonstram que um agente de pesquisa com IA pode melhorar sua própria eficiência de pesquisa por meio de autoaperfeiçoamento recursivo e que esses ganhos transferem-se para tarefas e domínios que o ciclo nunca encontrou.