Pesquisadores apresentam o AREX, uma família de agentes de pesquisa profunda Recursivamente Auto-Melhoráveis (RSI) projetados para abordar a assimetria entre descoberta e verificação em consultas complexas. O AREX alterna entre um loop interno que coleta evidências e constrói respostas provisórias, e um loop externo que audita restrições para guiar o refinamento direcionado.

O sistema emprega uma ferramenta autônoma de atualização de contexto para comprimir o histórico de interações em um estado compacto sem modelos externos. O treinamento utiliza treinamento intermediário agêntico e aprendizado por reforço de longo alcance em tarefas sintéticas verificadas, enfatizando etapas onde evidências decisivas são adquiridas ou erros são corrigidos. A equipe instancia versões densas de 4B e 122B-A10B Mixture-of-Experts do modelo.

Em benchmarks incluindo BrowseComp, WideSearch, DeepSearchQA e Humanity's Last Exam, o AREX supera substancialmente as linhas de base de escala comparável enquanto permanece competitivo em relação a modelos que utilizam significativamente mais parâmetros ativados.