Los investigadores presentan AREX, una familia de agentes de investigación profunda Recursivamente Auto-Mejorables (RSI) diseñados para abordar la asimetría entre descubrimiento y verificación en consultas complejas. AREX alterna entre un bucle interno que recopila evidencia y construye respuestas provisionales, y un bucle externo que audita restricciones para guiar el refinamiento dirigido.
El sistema emplea una herramienta autónoma de actualización de contexto para comprimir el historial de interacciones en un estado compacto sin modelos externos. El entrenamiento utiliza entrenamiento intermedio agéntico y aprendizaje por refuerzo de largo alcance en tareas sintéticas verificadas, enfatizando los pasos donde se adquiere evidencia decisiva o se corrigen errores. El equipo instancia versiones densas de 4B y 122B-A10B Mixture-of-Experts del modelo.
En benchmarks como BrowseComp, WideSearch, DeepSearchQA y Humanity's Last Exam, AREX supera sustancialmente a las líneas base de escala comparable mientras se mantiene competitivo frente a modelos que utilizan significativamente más parámetros activados.