يقترح الباحثون إطار عمل APEx للاستفادة الهرمية من الخبرات، والذي ينظم تاريخ التفاعلات إلى ذكريات مسار على مستوى المثال ومهارات إجرائية على مستوى الفئة لتحسين وكلاء البحث العميق.

  • يربط النظام هذه الذكريات عبر بنية حلقة مغلقة تتكون من وحدات Executor و Distiller و Planner.
  • يتم تحسين هذه الوحدات من خلال نموذج تدريب GRPO المتناوب ذو المراحل الثلاث لتقطير المهارات الموجهة بالمكافأة.
  • في وقت الاختبار، تعمل المهارات المقطّرة كأولويات إجرائية للتكيف مع Planner عبر الإنترنت باستخدام التعلم المعزز أثناء الاختبار الموجه بالمهارات.
  • تُظهر التجارب على 7 معايير قياس أن APEx يتفوق على GPT-5.4 بمقدار 14.7 نقطة وعلى أقوى خط أساس مدعوم بالذاكرة بمقدار 3.0 نقاط.

تتيح APEx التحسين الذاتي دون الحاجة إلى ground-truth، مع تنظيم مطابقة المهارات لمنع انحراف السياسة، محققةً أداءً متقدمًا في الأسئلة المعقدة.