Los investigadores presentan Argus, un entorno de ejecución agénico persistente y autoevolutivo diseñado para el razonamiento a largo plazo que separa la intención estable del usuario de los objetivos operativos. El sistema utiliza roles de Manager, Planner, Engineer y Reviewer para ejecutar misiones acotadas sobre un estado de proyecto duradero, permitiendo la ejecución autónoma entre puntos de escalación propiedad del operador.

  • En siete arenas de benchmarks de GPT-5.5, Argus alcanza aproximadamente el 78% en SWE-Bench Pro en comparación con el 59% de Direct Copilot, utilizando 1.41 veces los tokens agregados.
  • Después de la autoevolución con verificación condicionada, las olas maduras de SWE-Bench utilizan un 21% menos de tokens de entrada para resolver y un 15% menos de tiempo de flujo de trabajo activo por tarea que las olas iniciales.
  • El sistema registra 34 recuperaciones del verificador y 22 rescates estrictos en el bucle de revisión, alcanzando el 76.8% en AARRI-Bench y una brecha de 28.0 puntos en la síntesis de datos matemáticos.
  • Más allá de los benchmarks, se fusionó un kernel RWKV6 optimizado en el repositorio principal, y seis pipelines de artículos completaron 254 misiones con 16 retrocesos de etapa.

Estos resultados demuestran que un arnés de peso fijo y autoevolutivo puede revisar, recuperar y acumular enfoques verificados mientras produce trayectorias estructuradas para el aprendizaje supervisado y por refuerzo futuro.