Les chercheurs proposent APEx, un cadre d'utilisation hiérarchique des expériences qui organise l'historique des interactions en mémoires de trajectoire au niveau de l'instance et en compétences procédurales au niveau de la catégorie pour améliorer les agents de recherche profonde.

  • Le système couple ces mémoires via une architecture en boucle fermée composée des modules Executor, Distiller et Planner.
  • Ces modules sont optimisés par un paradigme d'entraînement GRPO alterné en trois étapes pour la distillation de compétences guidée par la récompense.
  • Au moment du test, les compétences distillées servent de priors procéduraux pour l'adaptation en ligne du Planner utilisant l'apprentissage par renforcement au moment du test guidé par les compétences.
  • Les expériences sur 7 benchmarks montrent que APEx dépasse GPT-5.4 de 14,7 points et la base de référence la plus forte augmentée de mémoire de 3,0 points.

APEx permet l'auto-amélioration sans ground-truth avec une régularisation d'alignement des compétences pour empêcher la dérive de la politique, atteignant des performances de pointe sur des questions complexes.