Бенчмарк · agentic

OSWorld

26 результатов 20 моделей

OSWorld — это бенчмарк, который проверяет агентов, управляющих компьютером, на реальных задачах десктопной операционной системы, охватывающих повседневные приложения (файловые менеджеры, веб-браузеры, офисные пакеты). Он показывает процент задач, которые агент выполняет успешно.

Подробнее
Пример
Задача может требовать открыть таблицу, изменить значение или переформатировать данные и сохранить файл — или найти файл в файловом менеджере и изменить системную настройку, — работая с реальным графическим интерфейсом (GUI) так же, как это делал бы человек.
Метрика
Метрика — доля успешно решённых задач (task success rate), выраженная в процентах. Каждая задача либо пройдена, либо нет, а итоговый балл — это доля пройденных задач по всему набору.
Приёмка
Результаты проверяются автоматически скриптами на основе выполнения, которые анализируют итоговое состояние системы (например, появился ли нужный файл, значение или настройка), а не сопоставлением текста или голосованием людей.
Почему важно
Он измеряет, могут ли ИИ-агенты действительно управлять настоящим компьютером во многих приложениях — это гораздо более сложная и реалистичная проверка автономности, чем ответы на вопросы или задачи в одном приложении.
Разбор примера
Задача
На рабочем столе Ubuntu открыт GNOME Terminal. В папке ~/project рекурсивно найдите все файлы .log размером больше 10 MB и удалите их, не трогая остальные файлы.
Решение
find ~/project -type f -name '*.log' -size +10M -delete
Разбор
find рекурсивно обходит ~/project, отбирает обычные файлы вида *.log размером больше 10 MB, а -delete удаляет именно их, не затрагивая всё остальное. OSWorld оценивает задачу отдельным чекером по итоговому состоянию файловой системы виртуальной машины (VM) и даёт reward 1 только если целевые logs удалены, а прочие файлы на месте.
0 22 44 66 88 2024-04-11 2025-06-03 2026-07-27 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI
Хронология
Дата Модель Результат Источник
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL позволяет проводить сквозное обучение агентов на основе хайринга в любой среде
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде
2026-07-21 Gemini 3.6 Flash 83.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber для агентных рабочих нагрузок
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber для агентных рабочих нагрузок
2026-07-21 Gemini 3.6 Flash 83.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI запускает семейство GPT-5.6 с моделями Sol, Terra и Luna
2026-07-06 OpenCUA-72B 48.9% Обучение на ошибках: самосовершенствование во время вывода для агентов компьютерного использования
2026-04-25 GPT-5.5 78.7% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 представляет фундаментальных GUI-агентов для нескольких платформ
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic выпустила Claude Sonnet 4.6 с улучшенным программированием, управлением компьютером и контекстом на 1 млн токенов
2026-02-05 Claude Opus 4.6 72.7% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2025-10-22 Surfer 2 60.1% Surfer 2 достигает состояния искусства в кроссплатформенном управлении компьютером через визуальное наблюдение
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic выпустила Claude Sonnet 4.5 с улучшенным программированием, управлением компьютером и выравниванием
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 продвигает GUI-агента с помощью многошагового обучения с подкреплением
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 представляет GUI-Owl, устанавливая новый SOTA среди открытых моделей на AndroidWorld и OSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 представляет GUI-Owl, устанавливая новый SOTA среди открытых моделей на AndroidWorld и OSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 представляет GUI-Owl, устанавливая новый SOTA среди открытых моделей на AndroidWorld и OSWorld
2025-01-23 CUA 38.1% OpenAI представляет агента Computer-Using Agent (CUA) для исследовательского предварительного просмотра Operator
2025-01-21 UI-TARS 24.6% UI-TARS представляет нативную модель GUI-агента, превосходящую коммерческие фреймворки
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic выпустила Claude 3.5 Haiku и обновлённую версию Claude 3.5 Sonnet с функцией управления компьютером
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic обновляет Claude 3.5 Sonnet, выпускает Claude 3.5 Haiku и бета-версию функции «computer use»
2024-04-11 best model 12.24% OSWorld представляет бенчмарк для мультимодальных агентов в реальных компьютерных средах