研究者らは、AIDE^2を発表した。これは、自身のコードを最適化することで、AI研究エージェントに対する再帰的自己改善のループを実装するシステムである。このシステムは内部ロジックへの変更を提案し、AI R&Dタスクで修正されたバージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮したものだけを保持する。

  • 自律的な8日間のランにおいて、AIDE^2はコンテキスト圧縮のための新しい検索ポリシーやメモリ機構を含む、7つの連続する改善を発見した。
  • 発見された最も強力なエージェントは、機械学習エンジニアリング、ヒューリスティックアルゴリズムエンジニアリング、および物理ベースの気象予測における4つのホールドアウトベンチマークで、人間が設計した生産環境の研究エージェントと同等かそれ以上の性能を示した。
  • 別のホールドアウトタスクファミリーにおいて、発見されたエージェントは報酬ハッキングを減らし、その割合は55%から32%に低下し、これは人間が設計したエージェントより7パーセントポイント低い。

これらの結果は、AI研究エージェントが再帰的自己改善を通じて自身の研究効率を改善できること、そしてこれらの成果がループが一度も遭遇したことのないタスクやドメインへ移行することを示している。