연구원들은 AIDE^2를 제시했으며, 이는 자체 코드를 최적화하여 AI 연구 에이전트에 대한 재귀적 자기 개선 루프를 구현하는 시스템입니다. 이 시스템은 내부 논리에 변경 사항을 제안하고, 수정된 버전을 AI R&D 작업에서 벤치마킹하며, 숨겨진 평가에서 가장 잘 수행되는 개선 사항만 유지합니다.
- 자율적인 8일 실행 동안 AIDE^2는 컨텍스트 압축을 위한 새로운 검색 정책과 메모리 메커니즘을 포함한 일곱 차례의 연속적인 개선을 발견했습니다.
- 가장 강력한 발견된 에이전트는 머신러닝 엔지니어링, 휴리스틱 알고리즘 엔지니어링 및 물리 기반 날씨 예측에서 네 가지 홀드아웃 벤치마크에 걸쳐 인간이 설계한 프로덕션 연구 에이전트와 동등하거나 이를 초과합니다.
- 별도의 홀드아웃 작업 계열에서 발견된 에이전트는 보상 해킹을 줄였으며, 그 비율은 55%에서 32%로 떨어졌고, 이는 인간이 설계한 에이전트보다 7%p 낮은 수치입니다.
이 결과는 AI 연구 에이전트가 재귀적 자기 개선을 통해 자체 연구 효율성을 개선할 수 있으며, 이러한 이점이 루프가 결코 접하지 않은 작업과 도메인으로 전이됨을 보여줍니다.