يقترح الباحثون APEx، وهو إطار عمل لاستخدام الخبرات بشكل هرمي مصمم لتحسين وكلاء البحث العميق الذين يجيبون على أسئلة معقدة باستخدام أدوات خارجية. ينظم النظام تاريخ التفاعلات إلى ذكريات مسار على مستوى المثيل ومهارات إجرائية على مستوى الفئة، ويربطهما عبر بنية Executor و Distiller و Planner.
- يتم التحسين من خلال نموذج تدريب GRPO المتناوب ذو المراحل الثلاث لتقطير المهارات الموجهة بالمكافأة.
- يستخدم المهارات المقطّرة كأولويات إجرائية للتكيف مع Planner عبر الإنترنت من خلال التعلم المعزز في وقت الاختبار الموجه بالمهارات.
- يحقق أداءً متقدمًا على 7 معايير، متفوقًا على GPT-5.4 بمقدار 14.7 نقطة وعلى أقوى خط أساس مدعوم بالذاكرة بمقدار 3.0 نقطة.
تتيح APEx التحسين الذاتي دون ground-truth مع تنظيم محاذاة المهارات لمنع انحراف السياسة أثناء الاختبار.