Para peneliti memperkenalkan AREX, sebuah keluarga agen riset mendalam Recursively Self-Improving (RSI) yang dirancang untuk mengatasi asimetri antara penemuan dan verifikasi dalam kueri kompleks. AREX bergantian antara loop internal yang mengumpulkan bukti dan membangun jawaban sementara, serta loop eksternal yang mengaudit batasan untuk memandu penyempurnaan terarah.
Sistem ini menggunakan alat pembaruan konteks otonom untuk mengompresi riwayat interaksi menjadi keadaan ringkas tanpa model eksternal. Pelatihan memanfaatkan pelatihan perantara agentic dan pembelajaran penguatan jangka panjang pada tugas sintetis terverifikasi, menekankan langkah-langkah di mana bukti penting diperoleh atau kesalahan diperbaiki. Tim menginisialisasi versi padat 4B dan 122B-A10B Mixture-of-Experts dari model tersebut.
Di berbagai benchmark termasuk BrowseComp, WideSearch, DeepSearchQA, dan Humanity's Last Exam, AREX secara substansial mengungguli baseline skala comparable sambil tetap kompetitif dibandingkan dengan model yang menggunakan jauh lebih banyak parameter teraktivasi.