Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen riset AI terdepan dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas-tugas R&D AI, dan hanya mempertahankan pembaruan yang berkinerja terbaik pada evaluasi tersembunyi.

  • Dalam satu kali berjalan otonom selama 8 hari, AIDE^2 menemukan tujuh peningkatan berturut-turut, termasuk kebijakan pencarian baru dan mekanisme memori untuk kompresi konteks.
  • Peningkatan-peningkatan ini bersifat umum ke empat benchmark yang dihold-out, mencakup teknik rekayasa machine learning, rekayasa algoritma heuristik, dan prakiraan cuaca berbasis fisika.
  • Pada keempat benchmark tersebut, agen terkuat yang ditemukan menyamai atau melampaui agen riset produksi yang direkayasa oleh manusia dan berada di antara yang terkuat pada FML-Bench.
  • Pada keluarga tugas yang terpisah dan dihold-out, agen-agen yang ditemukan menunjukkan pengurangan reward hacking, dengan tingkat penurunan dari 55% menjadi 32%, tujuh poin persentase lebih rendah daripada agen yang direkayasa oleh manusia.

Hasil-hasil ini menunjukkan bahwa agen riset AI dapat meningkatkan efisiensi risetnya sendiri melalui peningkatan diri secara rekursif dan bahwa peningkatan-peningkatan tersebut berpindah ke tugas-tugas dan domain yang tidak pernah ditemui oleh siklus tersebut.