Pesquisadores apresentam o Argus, um runtime agêntico persistente e autoevolutivo projetado para raciocínio de longo prazo que separa a intenção estável do usuário dos objetivos operacionais. O sistema utiliza funções de Gerente, Planejador, Engenheiro e Revisor para executar missões delimitadas sobre um estado de projeto durável, permitindo execução autônoma entre pontos de escalonamento de propriedade do operador.

  • Em sete arenas de benchmark do GPT-5.5, o Argus alcança cerca de 78% no SWE-Bench Pro em comparação a 59% para o Direct Copilot, usando 1,41 vezes mais tokens agregados.
  • Após autoevolução com verificação bloqueada, as ondas maduras do SWE-Bench usam 21% menos tokens de entrada de resolução e 15% menos tempo de fluxo de trabalho ativo por tarefa em comparação às ondas iniciais.
  • O sistema registra 34 recuperações de verificador e 22 salvamentos no loop estrito de revisão, alcançando 76,8% no AARRI-Bench e uma lacuna de 28,0 pontos na síntese de dados matemáticos.
  • Além dos benchmarks, um kernel RWKV6 otimizado foi mesclado ao repositório principal, e seis pipelines de artigos completaram 254 missões com 16 reversões de estágio.

Esses resultados demonstram que uma estrutura autoevolutiva de peso fixo pode revisar, recuperar e acumular abordagens verificadas enquanto produz trajetórias estruturadas para aprendizado supervisionado e por reforço futuros.