Benchmark · agentic

OSWorld

28 résultats 22 modèles

OSWorld est un benchmark qui évalue les agents d'utilisation d'ordinateur sur des tâches réelles d'un système d'exploitation de bureau, couvrant des applications du quotidien (gestionnaires de fichiers, navigateurs web, suites bureautiques). Il indique le pourcentage de tâches que l'agent accomplit avec succès.

En savoir plus
Exemple
Une tâche peut demander à l'agent d'ouvrir un tableur, de modifier une valeur ou de reformater des données et d'enregistrer le fichier, ou de trouver un fichier dans le gestionnaire de fichiers et de changer un paramètre système, en manipulant l'interface graphique (GUI) réelle comme le ferait une personne.
Notation
La métrique est le taux de réussite des tâches (task success rate), exprimé en pourcentage. Chaque tâche est réussie ou échouée, et le score est la fraction de tâches réussies sur l'ensemble complet.
Vérification
Les résultats sont vérifiés automatiquement par des scripts basés sur l'exécution qui inspectent l'état final de la machine (par exemple, si le bon fichier, la bonne valeur ou le bon paramètre existe désormais), plutôt que par correspondance de texte ou vote humain.
Pourquoi c'est important
Il mesure si les agents d'IA peuvent réellement piloter un vrai ordinateur à travers de nombreuses applications — un test d'autonomie bien plus difficile et réaliste que répondre à des questions ou des tâches sur une seule application.
Exemple résolu
Tâche
Un GNOME Terminal est ouvert sur le bureau Ubuntu. Dans le dossier ~/project, recherche de façon récursive tous les fichiers .log de plus de 10 MB et supprime-les, en laissant intacts tous les autres fichiers.
Solution
find ~/project -type f -name '*.log' -size +10M -delete
Explication
find parcourt ~/project de façon récursive, sélectionne les fichiers ordinaires nommés *.log dépassant 10 MB, et -delete supprime exactement ceux-là en épargnant le reste. OSWorld évalue avec un vérificateur propre à chaque tâche sur l'état final du système de fichiers de la machine virtuelle (VM) et n'accorde reward 1 que si les logs visés ont disparu et que les autres fichiers subsistent.
0 24 48 72 96 2024-04-11 2025-06-11 2026-08-11 best model · 12.2 · 2024-04-11 Claude 3.5 Sonnet (New) · 14.9 · 2024-10-22 Claude 3.5 Sonnet · 14.9 · 2024-10-22 UI-TARS · 24.6 · 2025-01-21 CUA · 38.1 · 2025-01-23 GUI-Owl-7B · 29.4 · 2025-08-21 Mobile-Agent-v3 · 37.7 · 2025-08-21 GUI-Owl (with TRPO) · 34.9 · 2025-08-21 UI-TARS-2 · 47.5 · 2025-09-02 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-29 Claude Sonnet 4.5 · 61.4 · 2025-09-30 Surfer 2 · 60.1 · 2025-10-22 Claude Opus 4.6 · 72.7 · 2026-02-05 Claude Sonnet 4.6 · 72.5 · 2026-02-17 GUI-Owl-1.5 · 56.5 · 2026-02-24 GPT-5.5 · 78.7 · 2026-04-25 OpenCUA-72B · 48.9 · 2026-07-06 GPT-5.6 Sol · 62.6 · 2026-07-09 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.6 Flash · 83 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 Gemini 3.5 Flash-Lite · 74 · 2026-07-21 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-24 OpenForgeGUI · 37.7 · 2026-07-27 Muse Glimmer · 65.9 · 2026-08-10 Opus 5 · 90.7 · 2026-08-11
best model Claude 3.5 Sonnet (New) Claude 3.5 Sonnet UI-TARS CUA GUI-Owl-7B Mobile-Agent-v3 GUI-Owl (with TRPO) UI-TARS-2 Claude Sonnet 4.5 Surfer 2 Claude Opus 4.6 Claude Sonnet 4.6 GUI-Owl-1.5 GPT-5.5 OpenCUA-72B GPT-5.6 Sol Gemini 3.6 Flash Gemini 3.5 Flash-Lite OpenForgeGUI Muse Glimmer Opus 5
Chronologie
Date Modèle Score Source
2026-08-11 Opus 5 90.69% L'agent auto-développant Ouroboros établit de nouveaux records avec Opus 5
2026-08-10 Muse Glimmer 65.9% Meta publie Muse Glimmer, un modèle agentique open-weights de 30B fonctionnant sur un GPU grand public
2026-07-27 OpenForgeGUI 37.7% OpenForgeRL permet l'entraînement de bout en bout d'agents à base de harnais dans n'importe quel environnement
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permet l'entraînement de bout en bout d'agents basés sur des harnais dans n'importe quel environnement
2026-07-24 OpenForgeGUI 37.7% OpenForgeRL permet l'entraînement de bout en bout d'agents à base de harnais dans n'importe quel environnement
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google publie Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber pour les charges de travail agentic
2026-07-21 Gemini 3.6 Flash 83.0% Google publie Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber pour les charges de travail agentic
2026-07-21 Gemini 3.6 Flash 83.0% Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber
2026-07-21 Gemini 3.5 Flash-Lite 74.0% Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber
2026-07-09 GPT-5.6 Sol 62.6% OpenAI lance la famille GPT-5.6 avec les modèles Sol, Terra et Luna
2026-07-06 OpenCUA-72B 48.9% Apprendre de l'échec : Auto-amélioration au moment de l'inférence pour les agents d'utilisation informatique
2026-04-25 GPT-5.5 78.7% OpenAI lance GPT-5.5, un modèle entièrement réentraîné avec traitement omnimodal natif
2026-02-24 GUI-Owl-1.5 56.5% GUI-Owl-1.5 introduit des agents GUI fondamentaux multi-plateformes
2026-02-17 Claude Sonnet 4.6 72.5% Anthropic lance Claude Sonnet 4.6 avec un codage amélioré, l'utilisation d'ordinateur et un contexte de 1M de tokens
2026-02-05 Claude Opus 4.6 72.7% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2025-10-22 Surfer 2 60.1% Surfer 2 atteint l'état de l'art pour l'utilisation d'ordinateur multiplateforme via l'observation visuelle
2025-09-30 Claude Sonnet 4.5 61.4% Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic lance Claude Sonnet 4.5 avec un codage, une utilisation de l'ordinateur et un alignement améliorés
2025-09-29 Claude Sonnet 4.5 61.4% Anthropic
2025-09-02 UI-TARS-2 47.5% UI-TARS-2 fait progresser les agents GUI grâce à l'apprentissage par renforcement multi-tours
2025-08-21 GUI-Owl-7B 29.4% Mobile-Agent-v3 introduit GUI-Owl, établissant un nouveau SOTA open-source sur AndroidWorld et OSWorld
2025-08-21 Mobile-Agent-v3 37.7% Mobile-Agent-v3 introduit GUI-Owl, établissant un nouveau SOTA open-source sur AndroidWorld et OSWorld
2025-08-21 GUI-Owl (with TRPO) 34.9% Mobile-Agent-v3 introduit GUI-Owl, établissant un nouveau SOTA open-source sur AndroidWorld et OSWorld
2025-01-23 CUA 38.1% OpenAI présente l'agent utilisant l'ordinateur (CUA) alimentant la prévisualisation de recherche d'Operator
2025-01-21 UI-TARS 24.6% UI-TARS présente un modèle d'agent GUI natif surpassant les frameworks commerciaux
2024-10-22 Claude 3.5 Sonnet (New) 14.9% Anthropic publie Claude 3.5 Haiku et met à jour Claude 3.5 Sonnet avec l'utilisation de l'ordinateur
2024-10-22 Claude 3.5 Sonnet 14.9% Anthropic met à jour Claude 3.5 Sonnet, lance Claude 3.5 Haiku et la version bêta de l'utilisation de l'ordinateur
2024-04-11 best model 12.24% OSWorld présente un benchmark pour les agents multimodaux dans des environnements informatiques réels