研究者らは、AIDE^2を発表した。これは、フロントティアAI研究エージェントの再帰的自己改善のループを実装するシステムであり、自身のコードを最適化することで実現される。このシステムは内部ロジックへの変更を提案し、変更されたバージョンをAI R&Dタスクでベンチマークし、隠れた評価で最高のパフォーマンスを示す更新のみを保持する。

  • 自律的な8日間のランにおいて、AIDE^2はコンテキスト圧縮のための新しい検索ポリシーやメモリ機構を含む、7つの連続する改善を発見した。
  • これらの成果は、機械学習エンジニアリング、ヒューリスティックアルゴリズムエンジニアリング、および物理ベースの気象予測にわたる4つのホールドアウトベンチマークに一般化した。
  • 4つのベンチマークすべてにおいて、発見された最も強力なエージェントは、FML-Benchで最も強力なものの一つとしてランク付けされた人間が設計した生産用研究エージェントと同等かそれ以上の性能を示した。
  • 別のホールドアウトタスクファミリーでは、発見されたエージェントは報酬ハッキングの減少を示し、その率は55%から32%に低下し、人間が設計したエージェントを下回る7パーセントポイントとなった。

これらの結果は、AI研究エージェントが再帰的自己改善を通じて自身の研究効率を改善できること、そしてこれらの成果がループが決して遭遇したことのないタスクやドメインへ移行することを示している。