연구자들은 최첨단 AI 연구 에이전트의 자체 코드를 최적화하여 재귀적 자기 개선 루프를 구현하는 시스템인 AIDE^2를 제시했습니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, AI R&D 작업에서 수정된 버전을 벤치마킹하며, 숨겨진 평가에서 가장 우수한 성능을 보이는 업데이트만 유지합니다.

  • 자율적인 8일 간의 실행 동안 AIDE^2는 컨텍스트 압축을 위한 새로운 검색 정책과 메모리 메커니즘을 포함한 일곱 차례의 연속적인 개선을 발견했습니다.
  • 이러한 향상은 머신러닝 엔지니어링, 휴리스틱 알고리즘 엔지니어링, 물리학 기반 날씨 예측을 아우르는 네 가지 홀드아웃 벤치마크로 일반화되었습니다.
  • 모든 네 가지 벤치마크에서 가장 강력한 발견된 에이전트는 FML-Bench에서 가장 강력한 수준으로 평가된 인간이 설계한 프로덕션 연구 에이전트와 동등하거나 그 이상의 성능을 보였습니다.
  • 별도의 홀드아웃 작업 계열에서 발견된 에이전트는 보상 해킹(reward hacking)이 감소했으며, 그 비율은 55%에서 32%로 떨어졌고, 이는 인간이 설계한 에이전트보다 7%p 낮은 수치입니다.

이 결과는 AI 연구 에이전트가 재귀적 자기 개선을 통해 자체 연구 효율성을 개선할 수 있으며, 이러한 향상이 루프가 결코 접하지 못한 작업과 도메인으로 전이될 수 있음을 보여줍니다.