研究者たちは、状態がポリシーのスタックであるマルコフ決定過程を定義することで多様なウェブタスクを解決するためにポリシーを動的に合成するアプローチであるSteP(Stacked LLM Policies for Web Actions)を提案している。静的な階層に制限された従来の方法とは異なり、この方法はタスクの複雑さに適応する動的制御を可能にする。
- WebArenaでは、StePはGPT-4ポリシーを使用するSOTA手法に対して14.9%から33.5%へパフォーマンスを向上させた。
- MiniWob++では、StePは以前の研究と競争力がありながら、大幅に少ないデータで済む。
- このアプローチは、制御を個別の動的呼び出しポリシーに分解することで、組み合わせ的に巨大なオープンワールドタスクや行動の漏洩といった課題に対処する。
著者たちはこれを重要と考えている。なぜなら、これはLLMがすべての可能な行動に対して大きなプロンプトを指定する複雑さなしに複雑なウェブインターフェースを処理できるからである。