研究人员提出了 APEx,这是一种分层经验利用框架,将交互历史组织为实例级轨迹记忆和类别级程序技能,以改进深度研究智能体。

  • 该系统通过由 Executor、Distiller 和 Planner 模块组成的闭环架构将这些记忆耦合在一起。
  • 这些模块通过三阶段交替 GRPO 训练范式进行优化,以实现奖励引导的技能提炼。
  • 在测试时,提炼出的技能作为程序先验,用于使用技能引导的测试时强化学习进行在线 Planner 适配。
  • 在 7 个基准上的实验表明,APEx 比 GPT-5.4 高出 14.7 分,比最强的记忆增强基线高出 3.0 分。

APEx 实现了无需真实标签的自我改进,并通过技能对齐正则化防止策略漂移,在复杂问题上取得了最先进的性能。