Исследователи представили WebArena, высоко реалистичную и воспроизводимую среду, предназначенную для создания и тестирования автономных агентов, управляемых языком. В отличие от предыдущих синтетических настроек, эта платформа предлагает полностью функциональные веб-сайты в четырех распространенных доменах: электронная коммерция, социальные форумы, совместная разработка программного обеспечения и управление контентом.

  • Среда включает такие инструменты, как карты и внешние базы знаний, чтобы поощрять решение задач, похожее на человеческое.
  • Опубликован бенчмарк с разнообразными задачами длительного горизонта для оценки функциональной правильности завершения агентами.
  • Базовые эксперименты показывают, что лучший агент на основе GPT-4 достигает лишь 14.41% успеха в выполнении задач от начала до конца.
  • Этот показатель значительно ниже человеческих результатов, которые составляют 78.24%.

Результаты подчеркивают, что современные передовые большие языковые модели далеки от совершенства в реальных задачах и демонстрируют полезность WebArena для измерения будущего прогресса.