Бенчмарк · agentic
Android World
AndroidWorld — это бенчмарк и среда с живым эмулятором (Google, 2024) для автономных агентов, управляющих реальным Android-устройством; в нём 116 созданных вручную задач в 20 реальных приложениях, а метрика — доля успешно выполненных задач (success rate).
Подробнее
- Пример
- Агент получает цель на естественном языке и должен управлять реальными приложениями, чтобы её достичь — например, в приложении-календаре создать событие с заданными названием, датой и временем, нажимая, вводя текст и прокручивая живой интерфейс.
- Метрика
- Каждая задача даёт бинарное вознаграждение: 1, если итоговое состояние устройства удовлетворяет условию успеха задачи, иначе 0. Оценка — это success rate, доля решённых задач, усреднённая по набору (задачи параметризованы случайными значениями, поэтому запуски различаются).
- Приёмка
- Успех проверяется программно — анализом состояния системы/приложения на устройстве после прогона (например, запрос к базе данных приложения, файлам или настройкам), а не сопоставлением траектории действий или с помощью LLM-судьи, что делает вознаграждения устойчивыми и воспроизводимыми.
- Почему важно
- Он оценивает агентов в реалистичном, открытом управлении мобильным устройством с проверяемыми вознаграждениями; случайные параметры препятствуют запоминанию, а реальные приложения и проверка по состоянию делают его устойчивым воспроизводимым стендом для мультимодальных агентов управления компьютером.
Разбор примера
Задача
Задача (семейство ContactsAddContact): «Создайте новый контакт для Grace Taylor. Номер телефона — 555-123-4567.» Агент действует в живом приложении «Контакты» через дерево доступности и скриншоты.
Решение
Откройте приложение «Контакты» → нажмите «Добавить контакт» → введите имя Grace Taylor → введите номер 555-123-4567 → нажмите «Сохранить». Итоговое состояние: в хранилище контактов устройства появился контакт с именем Grace Taylor и номером 555-123-4567.
Разбор
Верно, потому что проверщик успеха задачи запрашивает контакты на устройстве и убеждается, что существует контакт ровно с целевым именем и номером; оценка — это бинарная проверка состояния (вознаграждение 1/0), независимая от того, как агент туда пришёл.
| Дата | Модель | Результат | Источник |
|---|---|---|---|
| 2026-02-24 | GUI-Owl-1.5 | 71.6% | GUI-Owl-1.5 представляет фундаментальных GUI-агентов для нескольких платформ |
| 2025-10-22 | Surfer 2 | 87.1% | Surfer 2 достигает состояния искусства в кроссплатформенном управлении компьютером через визуальное наблюдение |
| 2025-09-02 | UI-TARS-2 | 73.3% | UI-TARS-2 продвигает GUI-агента с помощью многошагового обучения с подкреплением |
| 2025-08-21 | GUI-Owl-7B | 66.4% | Mobile-Agent-v3 представляет GUI-Owl, устанавливая новый SOTA среди открытых моделей на AndroidWorld и OSWorld |
| 2025-08-21 | Mobile-Agent-v3 | 73.3% | Mobile-Agent-v3 представляет GUI-Owl, устанавливая новый SOTA среди открытых моделей на AndroidWorld и OSWorld |
| 2025-01-21 | UI-TARS | 46.6% | UI-TARS представляет нативную модель GUI-агента, превосходящую коммерческие фреймворки |