Les chercheurs proposent APEx, un cadre d'utilisation hiérarchique des expériences conçu pour améliorer les agents de recherche profonde qui répondent à des questions complexes en utilisant des outils externes. Le système organise l'historique des interactions en mémoires de trajectoire au niveau de l'instance et en compétences procédurales au niveau de la catégorie, les couplant via une architecture Executor, Distiller et Planner.
- Optimisé via un paradigme d'entraînement GRPO alternant en trois étapes pour la distillation de compétences guidée par la récompense.
- Utilise des compétences distillées comme priors procéduraux pour l'adaptation en ligne du Planner via l'apprentissage par renforcement au moment du test guidé par les compétences.
- Atteint des performances de pointe sur 7 benchmarks, surpassant GPT-5.4 de 14,7 points et la baseline mémoire-augmentée la plus forte de 3,0 points.
APEx permet l'auto-amélioration sans ground-truth avec une régularisation d'alignement des compétences pour empêcher la dérive de la politique pendant les tests.