يقدم الباحثون AREX، وهو عائلة من وكلاء البحث العميق ذاتية التحسين المتكرر (RSI) المصممة لمعالجة عدم التماثل بين الاكتشاف والتحقق في الاستعلامات المعقدة. يتناوب AREX بين حلقة داخلية تجمع الأدلة وتبني إجابات مؤقتة، وحلقة خارجية تراجعت القيود لتوجيه التحسين المستهدف.
يستخدم النظام أداة تحديث سياق مستقلة لضغط تاريخ التفاعلات في حالة مدمجة دون نماذج خارجية. يستخدم التدريب تدريبًا وسيطًا وكيلياً والتعلم التعزيزي طويل المدى على مهام اصطناعية موثقة، مع التركيز على الخطوات التي يتم فيها الحصول على أدلة حاسمة أو تصحيح الأخطاء. قام الفريق بإنشاء إصدارات كثيفة 4B و122B-A10B Mixture-of-Experts للنموذج.
في معايير التقييم بما في ذلك BrowseComp وWideSearch وDeepSearchQA وHumanity's Last Exam، يتفوق AREX بشكل كبير على الخطوط الأساسية ذات الحجم المماثل مع الحفاظ على القدرة التنافسية مقارنة بالنماذج التي تستخدم عددًا أكبر بكثير من المعلمات النشطة.