Benchmark · agentic

Android World

6 resultados 6 modelos

AndroidWorld é um benchmark e ambiente de emulador ao vivo (Google, 2024) para agentes autônomos que controlam um dispositivo Android real; tem 116 tarefas feitas à mão em 20 apps reais, e a métrica é a taxa de sucesso das tarefas (success rate).

Saiba mais
Exemplo
O agente recebe um objetivo em linguagem natural e precisa operar apps reais para alcançá-lo — por exemplo, em um app de calendário, criar um evento com título, data e hora indicados, tocando, digitando e rolando pela interface ao vivo.
Pontuação
Cada tarefa dá uma recompensa binária: 1 se o estado final do dispositivo satisfaz a condição de sucesso da tarefa, e 0 caso contrário. A pontuação é a taxa de sucesso, a fração de tarefas resolvidas, com média sobre o conjunto (as tarefas são parametrizadas com valores aleatórios, então as execuções variam).
Verificação
O sucesso é verificado de forma programática, inspecionando o estado do sistema/app no dispositivo após a execução (por exemplo, consultando o banco de dados, os arquivos ou as configurações de um app), e não comparando a trajetória de ações nem usando um juiz LLM, o que torna as recompensas duráveis e reproduzíveis.
Por que importa
Ele avalia agentes em um controle de dispositivo móvel realista e aberto com recompensas verificáveis; parâmetros aleatórios desencorajam a memorização, e apps reais somados à avaliação baseada em estado o tornam um campo de testes durável e reproduzível para agentes multimodais de uso de computador.
Exemplo resolvido
Tarefa
Tarefa (família ContactsAddContact): «Crie um novo contato para Grace Taylor. O número de telefone é 555-123-4567.» O agente atua no app de Contatos ao vivo por meio da árvore de acessibilidade e de capturas de tela.
Solução
Abra o app de Contatos → toque em «Adicionar contato» → digite o nome Grace Taylor → digite o número 555-123-4567 → toque em «Salvar». Estado final: o armazenamento de contatos do dispositivo agora contém um contato chamado Grace Taylor com o número 555-123-4567.
Explicação
Está correto porque o verificador de sucesso da tarefa consulta os contatos do dispositivo e confirma que existe um contato com exatamente o nome e o número-alvo; a avaliação é uma checagem binária de estado (recompensa 1/0), independente de como o agente chegou lá.
0 23 46 69 92 2025-01-21 2025-08-08 2026-02-24 UI-TARS · 46.6 · 2025-01-21 GUI-Owl-7B · 66.4 · 2025-08-21 Mobile-Agent-v3 · 73.3 · 2025-08-21 UI-TARS-2 · 73.3 · 2025-09-02 Surfer 2 · 87.1 · 2025-10-22 GUI-Owl-1.5 · 71.6 · 2026-02-24
UI-TARS GUI-Owl-7B Mobile-Agent-v3 UI-TARS-2 Surfer 2 GUI-Owl-1.5
Linha do tempo
Data Modelo Pontuação Fonte
2026-02-24 GUI-Owl-1.5 71.6% GUI-Owl-1.5 introduz agentes fundamentais de GUI multiplataforma
2025-10-22 Surfer 2 87.1% Surfer 2 atinge o estado da arte no uso de computadores multiplataforma por observação visual
2025-09-02 UI-TARS-2 73.3% UI-TARS-2 avança agente de GUI com aprendizado por reforço multironda
2025-08-21 GUI-Owl-7B 66.4% Mobile-Agent-v3 apresenta o GUI-Owl, estabelecendo novo SOTA open-source no AndroidWorld e OSWorld
2025-08-21 Mobile-Agent-v3 73.3% Mobile-Agent-v3 apresenta o GUI-Owl, estabelecendo novo SOTA open-source no AndroidWorld e OSWorld
2025-01-21 UI-TARS 46.6% UI-TARS apresenta modelo nativo de agente de GUI que supera frameworks comerciais