研究者らは、外部ツールを使用して複雑な質問に答えるディープリサーチエージェントを改善するために設計された階層的経験利用フレームワークであるAPExを提案している。システムは相互作用履歴をインスタンスレベルの軌道記憶とカテゴリレベルの手順スキルに整理し、Executor、Distiller、Plannerアーキテクチャを通じて結合する。
- 報酬誘導型スキル蒸留のための3段階交互GRPO学習パラダイムによって最適化される。
- スキル誘導型テスト時強化学習を通じてオンラインPlanner適応の手順事前情報として蒸留されたスキルを使用する。
- 7つのベンチマークで最先端のパフォーマンスを達成し、GPT-5.4を14.7ポイント、最も強力なメモリ拡張ベースラインを3.0ポイント上回る。
APExは、テスト中のポリシードリフトを防ぐためにスキルアライメント正則化付きのグラウンドトゥルースなし自己改善を可能にする。