Pesquisadores introduziram o WebArena, um ambiente altamente realista e reproduzível projetado para construir e testar agentes autônomos guiados por linguagem. Ao contrário dos ambientes sintéticos anteriores, esta plataforma apresenta sites totalmente funcionais em quatro domínios comuns: comércio eletrônico, fóruns sociais, desenvolvimento colaborativo de software e gerenciamento de conteúdo.
- O ambiente inclui ferramentas como mapas e bases de conhecimento externas para incentivar a resolução de tarefas semelhante à humana.
- Um benchmark com tarefas diversas e de longo prazo é lançado para avaliar a correção funcional das conclusões do agente.
- Experimentos base mostram que o melhor agente baseado em GPT-4 alcança apenas uma taxa de sucesso de 14.41% em tarefas de ponta a ponta.
- Esse desempenho é significativamente menor que o desempenho humano, que está em 78.24%.
Os resultados destacam que os modelos de linguagem grandes mais avançados atuais estão longe de ser perfeitos em tarefas da vida real e demonstram a utilidade do WebArena para medir o progresso futuro.