शोधकर्ताओं ने AREX का परिचय दिया, जो एक परिवार है पुनरावर्ती रूप से स्वयं को सुधारने वाले (RSI) गहन शोध एजेंट्स का, जो जटिल क्वेरीज़ में खोज और सत्यापन के बीच असममितता को संबोधित करने के लिए डिज़ाइन किए गए हैं। AREX एक आंतरिक लूप के बीच बारी-बारी से काम करता है जो सबूत इकट्ठा करता है और अस्थायी उत्तर बनाता है, और एक बाहरी लूप जो निर्देशित सुधार को मार्गदर्शन करने के लिए बाधाओं का ऑडिट करता है।
सिस्टम एक स्वतंत्र संदर्भ-अपडेट टूल का उपयोग करता है ताकि बाहरी मॉडल के बिना इंटरैक्शन इतिहास को एक संपीड़ित स्थिति में संकुचित किया जा सके। प्रशिक्षण सत्यापित सिंथेटिक कार्यों पर एजेंटिक मिड-ट्रेनिंग और लॉन्ग-होराइजन रीइनफोर्समेंट लर्निंग का उपयोग करता है, जहाँ निर्णायक सबूत प्राप्त किए जाते हैं या त्रुटियों को सुधारा जाता है। टीम ने मॉडल के घने 4B और 122B-A10B Mixture-of-Experts संस्करणों को तत्काल किया।
BrowseComp, WideSearch, DeepSearchQA, और Humanity's Last Exam सहित बेंचमार्क्स में, AREX तुलनीय-स्केल बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है जबकि महत्वपूर्ण रूप से अधिक सक्रिय पैरामीटर का उपयोग करने वाले मॉडल्स के साथ प्रतिस्पर्धी बना हुआ है।