Benchmark · agentic

WebArena

9 resultados 9 modelos

O WebArena testa se um agente web autônomo consegue realizar tarefas reais de múltiplas etapas em um conjunto de sites realistas e auto-hospedados — loja online, um fórum e um gerenciador de conteúdo (CMS). Sua métrica é a task success rate (taxa de sucesso de tarefas): a porcentagem de tarefas que o agente conclui corretamente.

Saiba mais
Exemplo
Uma tarefa representativa: «encontrar o item mais barato de uma categoria e adicionar dois ao carrinho», que o agente deve cumprir navegando, clicando e digitando no site real.
Pontuação
A métrica é a taxa de sucesso de tarefas: tarefas concluídas divididas pelo total de tarefas, expressa como porcentagem.
Verificação
Cada tarefa vem com um verificador programático que confere o resultado automaticamente, seja comparando com a resposta esperada, seja inspecionando o estado final do site, de modo que a avaliação é feita por máquina, não por pessoas.
Por que importa
Mostra se agentes LLM realmente conseguem operar sites reais de ponta a ponta — um teste mais difícil e prático do que tarefas web de etapa única ou sintéticas —, tornando-se uma referência importante para a automação web com agentes.
Exemplo resolvido
Tarefa
Você é um agente web autônomo no ambiente GitLab auto-hospedado do WebArena: observa a árvore de acessibilidade (accessibility tree) da página e, a cada passo, emite uma ação do espaço de ações do WebArena (por exemplo, click [id], type [id] [text] [enter], goto [url], stop [answer]). Objetivo: criar uma nova issue com o título Bug: login button unresponsive no repositório a11yproject/a11yproject.com e atribuí-la a você mesmo.
Solução
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
Explicação
A trajetória abre o formulário de nova issue, digita o título exato, atribui a si mesmo pelo menu de responsável e envia; stop [N/A] encerra o episódio porque a tarefa altera o estado em vez de retornar um valor. O avaliador program_html do WebArena recarrega a issue criada e verifica o DOM de forma funcional — o título é igual à string e o responsável é o usuário logado —, então acertos aproximados recebem 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
Linha do tempo
Data Modelo Pontuação Fonte
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent estabelece estado da arte em benchmarks de uso móvel
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 introduz agentes fundamentais de GUI multiplataforma
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent introduz evolução adaptativa de conhecimento para automação web robusta de longo prazo
2025-10-22 Surfer 2 69.6% Surfer 2 atinge o estado da arte no uso de computadores multiplataforma por observação visual
2025-01-23 CUA 58.1% OpenAI apresenta Agente de Uso do Computador (CUA) que impulsiona a prévia de pesquisa do Operator
2024-10-17 AgentOccam 9.8% AgentOccam alinha espaços de observação e ação para impulsionar o desempenho de agentes web baseados em LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 alcança 57,14% no benchmark WebArena
2023-10-05 SteP 33.5% SteP usa políticas de LLM empilhadas para melhorar o desempenho em tarefas web
2023-07-25 GPT-4-based agent 14.41% WebArena: ambiente web realista para agentes autônomos