Исследователи представляют Argus — постоянную, самоэволюционирующую агентную среду выполнения, предназначенную для рассуждений на длительных горизонтах, которая разделяет стабильные намерения пользователя и операционные цели. Система использует роли Manager, Planner, Engineer и Reviewer для выполнения ограниченных миссий в условиях долговременного состояния проекта, что позволяет осуществлять автономное выполнение между точками эскалации, контролируемыми оператором.
- В семи аренах бенчмарков GPT-5.5 Argus достигает около 78% на SWE-Bench Pro по сравнению с 59% для Direct Copilot, используя в 1.41 раза больше агрегированных токенов.
- После самоэволюции с верификацией через шлюз зрелые волны SWE-Bench используют на 21% меньше токенов solve-input и на 15% меньше активного времени рабочего процесса на задачу по сравнению с начальными волнами.
- Система записывает 34 восстановления валидатора и 22 спасения через строгий цикл рецензирования, достигая 76.8% на AARRI-Bench и разрыва в 28.0 баллов на синтезе математических данных.
- Помимо бенчмарков, оптимизированное ядро RWKV6 было объединено с основной веткой, а шесть конвейеров статей завершили 254 миссии с 16 откатами этапов.
Эти результаты демонстрируют, что фиксированная по весу, самоэволюционирующая платформа может пересматривать, восстанавливать и накапливать проверенные подходы, одновременно формируя структурированные траектории для будущего контролируемого и подкрепляющего обучения.