研究人员提出了 SteP(Stacked LLM Policies for Web Actions),这是一种通过定义马尔可夫决策过程来动态组合策略以解决多样化网页任务的方法,其中状态是策略的堆栈。与局限于静态层次结构的传统方法不同,该方法实现了适应任务复杂性的动态控制。
- 在 WebArena 上,SteP 使用 GPT-4 策略将性能从 14.9% 提升至 33.5%,优于 SOTA 方法。
- 在 MiniWob++ 上,SteP 与先前的工作具有竞争力,同时所需数据显著减少。
- 该方法通过将控制分解为不同的动态调用策略,解决了组合爆炸的开放世界任务和行为泄漏等挑战。
作者认为这很重要,因为它允许 LLM 处理复杂的网页界面,而无需为所有可能的行为指定大型提示。