研究者らは、対話履歴をインスタンスレベルの軌道メモリとカテゴリレベルの手順スキルに整理し、ディープリサーチエージェントを改善するための階層的経験利用フレームワークであるAPExを提案している。
- システムは、Executor、Distiller、Plannerモジュールで構成されるクローズドループアーキテクチャを通じてこれらのメモリを結合する。
- これらのモジュールは、報酬誘導型スキル蒸留のための3段階交互GRPO学習パラダイムによって最適化される。
- テスト時には、蒸留されたスキルが手順事前知識として機能し、スキル誘導型テスト時強化学習を用いてオンラインPlanner適応を行う。
- 7つのベンチマークでの実験により、APExはGPT-5.4を14.7ポイント、最も強力なメモリ拡張ベースラインを3.0ポイント上回ることを示している。
APExは、ポリシードリフトを防ぐためのスキルアライメント正則化を用いたground-truth不要の自己改善を可能にし、複雑な質問において最先端のパフォーマンスを実現する。