Les chercheurs présentent AREX, une famille d'agents de recherche profonde Récursivement Auto-Améliorables (RSI) conçus pour résoudre l'asymétrie entre découverte et vérification dans les requêtes complexes. AREX alterne entre une boucle interne qui rassemble des preuves et construit des réponses provisoires, et une boucle externe qui audite les contraintes pour guider le raffinement ciblé.
Le système utilise un outil autonome de mise à jour du contexte pour compresser l'historique des interactions dans un état compact sans modèles externes. L'entraînement utilise un entraînement intermédiaire agentique et un apprentissage par renforcement à long terme sur des tâches synthétiques vérifiées, en mettant l'accent sur les étapes où des preuves décisives sont acquises ou des erreurs corrigées. L'équipe a instancié des versions denses 4B et 122B-A10B Mixture-of-Experts du modèle.
Sur les benchmarks incluant BrowseComp, WideSearch, DeepSearchQA et Humanity's Last Exam, AREX surpasse substantiellement les lignes de base à échelle comparable tout en restant compétitif par rapport aux modèles utilisant significativement plus de paramètres activés.