Исследователи представили WebArena, высоко реалистичную и воспроизводимую среду, предназначенную для создания и тестирования автономных агентов, управляемых языком. В отличие от предыдущих синтетических настроек, эта платформа предлагает полностью функциональные веб-сайты в четырех распространенных доменах: электронная коммерция, социальные форумы, совместная разработка программного обеспечения и управление контентом.
- Среда включает такие инструменты, как карты и внешние базы знаний, чтобы поощрять решение задач, похожее на человеческое.
- Опубликован бенчмарк с разнообразными задачами длительного горизонта для оценки функциональной правильности завершения агентами.
- Базовые эксперименты показывают, что лучший агент на основе GPT-4 достигает лишь 14.41% успеха в выполнении задач от начала до конца.
- Этот показатель значительно ниже человеческих результатов, которые составляют 78.24%.
Результаты подчеркивают, что современные передовые большие языковые модели далеки от совершенства в реальных задачах и демонстрируют полезность WebArena для измерения будущего прогресса.