연구자들은 복잡한 쿼리에서 발견과 검증 사이의 비대칭성을 해결하도록 설계된 재귀적 자기 개선(RSI) 심층 연구 에이전트 패밀리인 AREX를 소개합니다. AREX는 증거를 수집하고 임시 답변을 구축하는 내부 루프와 제약을 감사하여 대상 세밀화를 안내하는 외부 루프를 교대로 실행합니다.
시스템은 외부 모델 없이 상호 작용 이력을 컴팩트한 상태로 압축하기 위한 자율 컨텍스트 업데이트 도구를 사용합니다. 훈련은 검증된 합성 작업에서 에이전트 미드-트레이닝과 장기 관점 강화 학습을 활용하며, 결정적인 증거가 획득되거나 오류가 수정되는 단계를 강조합니다. 팀은 모델의 밀집 4B 및 122B-A10B Mixture-of-Experts 버전을 구현했습니다.
BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam 등 벤치마크에서 AREX는 동등한 규모의 베이스라인을 크게 능가하면서도 상당히 더 많은 활성화된 매개변수를 사용하는 모델들과 경쟁력 있게 유지됩니다.