Para peneliti menyajikan AIDE^2, sebuah sistem yang mengimplementasikan siklus peningkatan diri secara rekursif untuk agen penelitian AI dengan mengoptimalkan kode internalnya sendiri. Sistem ini mengusulkan perubahan pada logika internalnya, melakukan benchmarking versi yang dimodifikasi pada tugas R&D AI, dan hanya mempertahankan peningkatan yang menunjukkan kinerja terbaik pada evaluasi tersembunyi.
- Dalam pelaksanaan otonom selama 8 hari, AIDE^2 menemukan tujuh peningkatan berturut-turut, termasuk kebijakan pencarian baru dan mekanisme memori untuk kompresi konteks.
- Agen yang ditemukan dengan kemampuan terkuat menyamai atau melampaui agen penelitian produksi yang direkayasa oleh manusia di empat benchmark yang diisolasi dalam teknik rekayasa machine learning, teknik rekayasa algoritma heuristik, dan prakiraan cuaca berbasis fisika.
- Pada keluarga tugas terisolasi yang terpisah, agen-agen yang ditemukan menunjukkan pengurangan reward hacking, dengan tingkat penurunan dari 55% menjadi 32%, yaitu 7 poin persentase lebih rendah daripada agen yang direkayasa oleh manusia.
Hasil-hasil ini menunjukkan bahwa agen penelitian AI dapat meningkatkan efisiensi penelitiannya sendiri melalui peningkatan diri secara rekursif dan bahwa manfaat tersebut berpindah ke tugas dan domain yang tidak pernah ditemui oleh siklus tersebut.