Les chercheurs présentent Argus, un runtime agentique persistant et auto-évolutif conçu pour le raisonnement à long terme qui sépare l'intention utilisateur stable des objectifs opérationnels. Le système utilise les rôles Manager, Planner, Engineer et Reviewer pour exécuter des missions bornées sur un état de projet durable, permettant une exécution autonome entre les points d'escalade détenus par l'opérateur.

  • Sur sept arènes de benchmark GPT-5.5, Argus atteint environ 78 % sur SWE-Bench Pro contre 59 % pour Direct Copilot, en utilisant 1,41 fois le nombre total de tokens.
  • Après une auto-évolution à validation par vérification, les vagues matures de SWE-Bench utilisent 21 % de moins de tokens d'entrée de résolution et 15 % moins de temps de workflow actif par tâche que les vagues initiales.
  • Le système enregistre 34 récupérations par vérificateur et 22 sauvetages par boucle de révision stricte, atteignant 76,8 % sur AARRI-Bench et un écart de 28,0 points sur la synthèse de données mathématiques.
  • Au-delà des benchmarks, un noyau RWKV6 optimisé a été fusionné en amont, et six pipelines de papiers ont accompli 254 missions avec 16 retours d'étape.

Ces résultats démontrent qu'un harnais à poids fixe et auto-évolutif peut réviser, récupérer et accumuler des approches vérifiées tout en produisant des trajectoires structurées pour l'apprentissage supervisé et par renforcement futurs.