Исследователи представляют AREX, семейство рекурсивно самоусовершенствующихся (RSI) агентов глубокого исследования, предназначенных для решения асимметрии между обнаружением и проверкой в сложных запросах. AREX чередует внутренний цикл, собирающий доказательства и формирующий предварительные ответы, с внешним циклом, проверяющим ограничения для направленного уточнения.

Система использует автономный инструмент обновления контекста для сжатия истории взаимодействий в компактное состояние без внешних моделей. Обучение использует агентное промежуточное обучение и долгосрочное обучение с подкреплением на проверенных синтетических задачах, акцентируя шаги, где получены решающие доказательства или исправлены ошибки. Команда создала плотные версии модели 4B и 122B-A10B Mixture-of-Experts.

По результатам тестов, включая BrowseComp, WideSearch, DeepSearchQA и Humanity's Last Exam, AREX значительно превосходит базовые модели сопоставимого масштаба, оставаясь конкурентоспособным по сравнению с моделями, использующими значительно больше активированных параметров.