研究者らは、標準的な大規模言語モデルの信頼性が低下しがちな複雑なタスクにおいて高品質な自然言語実行可能な計画を生成するために設計された、戦略認識型のマルチステージ計画フレームワークであるGRASPを紹介している。このシステムは計画パイプラインを専門化されたモジュールに分離する:グローバルなマクロ指針のためのGenPlan、局所的な戦略の探索のためのRevPlan、独立した軌道評価のためのVerPlan。

  • GRASPは多様なデータセットで新たな最先端を確立し、直接LLMプランナーと比較してNatural Plan Calendar Schedulingで約12.4%、ZebraLogicで約30.8%の精度向上をもたらす。
  • このフレームワークは標準的なプランナーで観察されるマルチタスク劣化ペナルティを完全に平坦化し、インターリーブされた二重タスク環境において最大16.7%の絶対精度向上を実現する。
  • コンテキストを分離し厳格なマクロ正則化を強制することで、GRASPはGPT-5-miniのような最先端の推論モデルを14.5%の差で上回る。

このアプローチはタスクの複雑さが増す中でパフォーマンスを維持するという課題に対処し、直接LLM計画手法に対して大幅な改善を提供する。