研究人员推出了 AREX,这是一个递归自我改进(RSI)深度研究智能体家族,旨在解决复杂查询中发现与验证之间的不对称问题。AREX 在内循环(收集证据并构建临时答案)和外循环(审计约束以指导针对性优化)之间交替运行。

该系统采用自主上下文更新工具,无需外部模型即可将交互历史压缩为紧凑状态。训练利用智能体中间训练和经过验证的合成任务上的长视域强化学习,重点强调获取决定性证据或纠正错误的步骤。团队实例化了该模型的密集 4B 和 122B-A10B Mixture-of-Experts 版本。

在 BrowseComp、WideSearch、DeepSearchQA 和 Humanity's Last Exam 等基准测试中,AREX 大幅优于同等规模的基线模型,同时在与使用显著更多激活参数的模型相比时仍保持竞争力。