研究人员推出了 WebArena,这是一个高度逼真且可复现的环境,旨在构建和测试由语言引导的自主代理。与之前的合成设置不同,该平台在四个常见领域提供了完全功能齐全的网站:电子商务、社交论坛、协作软件开发和内容管理。

  • 该环境包括地图和外部知识库等工具,以鼓励类似人类的任务解决方式。
  • 发布了一个包含多样化长周期任务的基准测试,用于评估代理完成的功能正确性。
  • 基线实验显示,基于 GPT-4 的最佳代理端到端任务成功率仅为 14.41%。
  • 这一表现显著低于人类表现,后者为 78.24%。

结果表明,当前最先进的语言大模型在现实生活中的任务中远非完美,并展示了 WebArena 在衡量未来进展方面的效用。