研究人员提出了 APEx,这是一种分层经验利用框架,旨在通过使用外部工具回答复杂问题的深度研究智能体。该系统将交互历史组织为实例级轨迹记忆和类别级程序技能,并通过 Executor、Distiller 和 Planner 架构将它们耦合。
- 通过三阶段交替 GRPO 训练范式进行优化,以实现奖励引导的技能提炼。
- 使用提炼后的技能作为程序先验,通过技能引导的测试时强化学习实现在线 Planner 自适应。
- 在 7 个基准测试中达到最先进水平,比 GPT-5.4 高出 14.7 分,比最强的记忆增强基线高出 3.0 分。
APEx 实现了无需 ground-truth 的自我改进,并通过技能对齐正则化防止测试期间的策略漂移。