研究者たちは、複雑なクエリにおける発見と検証の非対称性に対処するために設計された、再帰的自己改善(RSI)ディープリサーチエージェントのファミリーであるAREXを紹介します。AREXは、証拠を収集して暫定的な回答を構築する内部ループと、制約を監査して対象的な改良をガイドする外部ループを交互に実行します。
システムは、外部モデルなしで対話履歴をコンパクトな状態に圧縮するための自律コンテキスト更新ツールを採用しています。トレーニングは、検証済みの合成タスク上でエージェント型中間トレーニングと長期強化学習を利用し、決定的な証拠が取得されるステップやエラーが修正されるステップを強調します。チームは、モデルの密集4Bおよび122B-A10B Mixture-of-Expertsバージョンを実装しました。
BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Examなどのベンチマークにおいて、AREXは同等規模のベースラインを大幅に上回りながら、著しく多くのアクティブパラメータを使用するモデルと比較しても競争力を持っています。