शोधकर्ताओं ने Argus प्रस्तुत किया, जो एक स्थिर, स्वयं-विकासशील एजेंटिक रनटाइम है जिसका डिज़ाइन दीर्घकालिक तर्क के लिए किया गया है और यह स्थिर उपयोगकर्ता इरादे को संचालनात्मक उद्देश्यों से अलग करता है। प्रणाली Manager, Planner, Engineer, और Reviewer भूमिकाओं का उपयोग करके टिकाऊ परियोजना अवस्था पर सीमित मिशन निष्पादित करती है, जिससे ऑपरेटर-स्वामित्व वाले एस्केलेशन बिंदुओं के बीच स्वतंत्र निष्पादन संभव होता है।

  • सात GPT-5.5 बेंचमार्क एरिना में, Argus ने SWE-Bench Pro पर लगभग 78% हासिल किया, जबकि Direct Copilot के लिए यह 59% था, और इसने समग्र टोकन का 1.41 गुना उपयोग किया।
  • सत्यापन-गेटेड स्वयं-विकास के बाद, परिपक्व SWE-Bench वेव्स ने स्टार्टअप वेव्स की तुलना में प्रति कार्य कम हल-इनपुट टोकन का 21% और सक्रिय वर्कफ़्लो समय का 15% कम उपयोग किया।
  • प्रणाली ने 34 सत्यापक पुनर्प्राप्ति और 22 कठोर समीक्षा-लूप बचाव दर्ज किए, जिसने AARRI-Bench पर 76.8% हासिल किया और गणितीय डेटा संश्लेषण पर 28.0 अंक का अंतर दिखाया।
  • बेंचमार्क के परे, एक अनुकूलित RWKV6 kernels को अपस्ट्रीम विलीन कर दिया गया, और छह पेपर पाइपलाइन ने 16 चरण रोलबैक के साथ 254 मिशन पूरे किए।

ये परिणाम दर्शाते हैं कि एक स्थिर-वजन वाला, स्वयं-विकासशील हार्नेस सत्यापित दृष्टिकोणों को संशोधित, पुनर्स्थापित और संचित कर सकता है जबकि भविष्य के निगरानी और प्रबलन शिक्षण के लिए संरचित ट्राजेक्टरी उत्पन्न करता है।