Бенчмарк · agentic

WebArena

9 результатов 9 моделей

WebArena проверяет, может ли автономный web-агент выполнять реальные многошаговые задачи на наборе реалистичных, развёрнутых локально сайтов — интернет-магазин, форум и система управления контентом (CMS). Метрика — task success rate: процент задач, которые агент выполнил правильно.

Подробнее
Пример
Типичная задача: «найти самый дешёвый товар в категории и добавить две штуки в корзину» — агент должен достичь цели, перемещаясь по страницам, кликая и вводя текст на живом сайте.
Метрика
Метрика — task success rate: число выполненных задач, делённое на общее число задач, в процентах.
Приёмка
К каждой задаче прилагается программная проверка, которая автоматически подтверждает результат — сравнивая с ожидаемым ответом или проверяя итоговое состояние сайта, — поэтому оценка машинная, а не человеческая.
Почему важно
Он показывает, могут ли LLM-агенты реально управлять настоящими сайтами от начала до конца — более сложная и практичная проверка, чем одношаговые или синтетические web-задачи, — и потому служит ключевым ориентиром для агентной web-автоматизации.
Разбор примера
Задача
Вы — автономный веб-агент в самостоятельно развёрнутой среде GitLab из WebArena: вы наблюдаете дерево доступности (accessibility tree) страницы и на каждом шаге выдаёте одно действие из пространства действий WebArena (например, click [id], type [id] [text] [enter], goto [url], stop [answer]). Задача: создать новый issue с заголовком Bug: login button unresponsive в репозитории a11yproject/a11yproject.com и назначить его на себя.
Решение
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
Разбор
Траектория открывает форму нового issue, вводит точный заголовок, назначает задачу на себя через меню исполнителя и отправляет форму; stop [N/A] завершает эпизод, потому что задача меняет состояние, а не возвращает значение. Оценщик program_html в WebArena перезагружает созданный issue и функционально проверяет DOM — заголовок совпадает со строкой, а исполнитель равен вошедшему пользователю, — поэтому неточные совпадения получают 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
Хронология
Дата Модель Результат Источник
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent устанавливает новый стандарт на бенчмарках мобильного использования
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 представляет фундаментальных GUI-агентов для нескольких платформ
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent представляет адаптивную эволюцию знаний для надежной долгосрочной веб-автоматизации
2025-10-22 Surfer 2 69.6% Surfer 2 достигает состояния искусства в кроссплатформенном управлении компьютером через визуальное наблюдение
2025-01-23 CUA 58.1% OpenAI представляет агента Computer-Using Agent (CUA) для исследовательского предварительного просмотра Operator
2024-10-17 AgentOccam 9.8% AgentOccam согласовывает пространства наблюдений и действий для повышения эффективности веб-агентов на базе LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 достигает 57,14% на бенчмарке WebArena
2023-10-05 SteP 33.5% SteP использует стекированные политики LLM для улучшения выполнения веб-задач
2023-07-25 GPT-4-based agent 14.41% WebArena: реалистичная веб-среда для автономных агентов