يقترح الباحثون إطار عمل APEx للاستفادة الهرمية من الخبرات، والذي ينظم تاريخ التفاعلات إلى ذكريات مسار على مستوى المثال ومهارات إجرائية على مستوى الفئة لتحسين وكلاء البحث العميق.
- يربط النظام هذه الذكريات عبر بنية حلقة مغلقة تتكون من وحدات Executor و Distiller و Planner.
- يتم تحسين هذه الوحدات من خلال نموذج تدريب GRPO المتناوب ذو المراحل الثلاث لتقطير المهارات الموجهة بالمكافأة.
- في وقت الاختبار، تعمل المهارات المقطّرة كأولويات إجرائية للتكيف مع Planner عبر الإنترنت باستخدام التعلم المعزز أثناء الاختبار الموجه بالمهارات.
- تُظهر التجارب على 7 معايير قياس أن APEx يتفوق على GPT-5.4 بمقدار 14.7 نقطة وعلى أقوى خط أساس مدعوم بالذاكرة بمقدار 3.0 نقاط.
تتيح APEx التحسين الذاتي دون الحاجة إلى ground-truth، مع تنظيم مطابقة المهارات لمنع انحراف السياسة، محققةً أداءً متقدمًا في الأسئلة المعقدة.