研究者らは、安定したユーザー意図と運用目標を分離し、長期推論のために設計された永続的で自己進化型のエージェントランタイムであるArgusを発表した。このシステムは、Manager、Planner、Engineer、Reviewerの役割を活用して、耐久性のあるプロジェクト状態上で制約付きミッションを実行し、オペレーターによるエスカレーションポイント間で自律的な実行を可能にする。
- 7つのGPT-5.5ベンチマークアリーナにおいて、ArgusはSWE-Bench Proで約78%の性能を達成しており、Direct Copilotの59%と比較して、集計トークン数は1.41倍を使用している。
- 検証ゲート付き自己進化後、成熟したSWE-Benchウェーブでは、起動時ウェーブと比較してタスクあたりのsolve-inputトークンが21%減少し、アクティブなワークフロー時間が15%短縮された。
- システムは34回のverifierリカバリと22回の厳格なレビューループの救出を記録し、AARRI-Benchで76.8%、数学データ合成で28.0ポイントのギャップを達成した。
- ベンチマークに加え、最適化されたRWKV6カーネルがアップストリームにマージされ、6つの論文パイプラインが16回のステージロールバックとともに254件のミッションを完了した。
これらの結果は、固定重みの自己進化型ハーネスが、検証済みのアプローチを修正、回復、蓄積しながら、将来の教師あり学習および強化学習のための構造化された軌道を生成できることを示している。