يقدم الباحثون أرجوس، وهي بيئة تشغيل عميلية ذاتية التطور ودائمة مصممة للاستدلال طويل المدى تفصل بين نوايا المستخدم الثابتة والأهداف التشغيلية. تستخدم النظام أدوار المدير والمخطط والمهندس والمراجع لتنفيذ مهام محدودة عبر حالة مشروع متينة، مما يسمح بالتنفيذ الذاتي بين نقاط التصعيد المملوكة للمشغل.
- في سبعة مجالات معيارية لـ GPT-5.5، يحقق أرجوس حوالي 78% على SWE-Bench Pro مقارنة بـ 59% لـ Direct Copilot، باستخدام 1.41 مرة من إجمالي الرموز.
- بعد التطور الذاتي المقيد بالتحقق، تستخدم موجات SWE-Bench الناضجة أقل بنسبة 21% من رموز المدخلات للحل وأقل بنسبة 15% من وقت سير العمل النشط لكل مهمة مقارنة بالموجات الأولية.
- يسجل النظام 34 استعادة للتحقق و22 إنقاذًا لحلقة المراجعة الصارمة، ليصل إلى 76.8% على AARRI-Bench وفارق قدره 28.0 نقطة في توليف البيانات الرياضية.
- بما يتجاوز المعايير، تم دمج نواة RWKV6 المحسّنة في المستودع الرئيسي، وأكملت ستة خطوط أنابيب الأوراق البحثية 254 مهمة مع 16 تراجعًا للمرحلة.
تُظهر هذه النتائج أن السلسلة ذات الأوزان الثابتة والقادرة على التطور الذاتي يمكنها مراجعة واستعادة وتراكم الأساليب الموثوقة مع إنتاج مسارات منظمة للتعلم الخاضع للإشراف والتعلم التعزيزي في المستقبل.