研究人员介绍了 AgentOccam,这是一种基于 LLM 的 Web 智能体的基线方法,通过优化观测空间和动作空间以更好地与模型的预训练数据对齐,从而提升性能。该方法消除了对上下文示例或多智能体系统等手工策略的需求。

  • 在 WebArena 基准测试中,AgentOccam 超越此前的 state-of-the-art 方法 9.8 个绝对百分点(+29.4%),并超越同期工作 5.9 个绝对百分点(+15.8%)。
  • 与类似的普通 Web 智能体相比,该方法将成功率提升了 26.6 个百分点(+161%)。
  • 该设计展示了 LLM 在无需在线反馈或搜索策略的情况下处理 Web 任务的 zero-shot 性能。

研究强调了为基于 LLM 的智能体仔细调整观测和动作空间对于在现实场景中泛化的关键作用。