研究人员提出了 Argus,这是一种持久且自我演进的代理运行时系统,专为长程推理设计,能够将稳定的用户意图与操作目标分离。该系统利用管理器、规划器、工程师和审查者角色,在持久的项目状态上执行有界任务,允许在操作员拥有的升级点之间进行自主执行。

  • 在七个 GPT-5.5 基准竞技场中,Argus 在 SWE-Bench Pro 上达到约 78%,而 Direct Copilot 为 59%,使用的聚合令牌量是其 1.41 倍。
  • 经过验证门控的自我演进后,成熟的 SWE-Bench 波次相比初始波次,每个任务使用的求解输入令牌减少 21%,活跃工作流时间减少 15%。
  • 该系统记录了 34 次验证器恢复和 22 次严格审查循环救援,在 AARRI-Bench 上达到 76.8%,在数学数据合成方面取得 28.0 分的差距。
  • 除基准测试外,优化的 RWKV6 内核已合并至上游,六个论文流水线完成了 254 项任务,其中包含 16 次阶段回滚。

这些结果表明,固定权重的自我演进框架能够修订、恢复并积累经过验证的方法,同时为未来的监督学习和强化学习生成结构化轨迹。