Pesquisadores propõem o APEx, uma estrutura de utilização hierárquica de experiências que organiza o histórico de interações em memórias de trajetória em nível de instância e habilidades procedimentais em nível de categoria para melhorar agentes de pesquisa profunda.

  • O sistema acopla essas memórias por meio de uma arquitetura de loop fechado composta pelos módulos Executor, Distiller e Planner.
  • Esses módulos são otimizados por meio de um paradigma de treinamento GRPO alternante em três etapas para destilação de habilidades guiada por recompensa.
  • No momento do teste, as habilidades destiladas servem como priores procedimentais para a adaptação online do Planner usando aprendizado por reforço durante o teste guiado por habilidades.
  • Experimentos em 7 benchmarks mostram que o APEx supera o GPT-5.4 em 14.7 pontos e a linha de base mais forte aumentada com memória em 3.0 pontos.

O APEx permite autoaperfeiçoamento sem necessidade de ground-truth, com regularização de alinhamento de habilidades para evitar deriva da política, alcançando desempenho de ponta em perguntas complexas.