Benchmark · agentic

WebArena

9 résultats 9 modèles

WebArena teste si un agent web autonome peut accomplir de vraies tâches en plusieurs étapes sur un ensemble de sites réalistes et auto-hébergés — boutique en ligne, un forum et un système de gestion de contenu (CMS). Sa métrique est le task success rate (taux de réussite des tâches) : le pourcentage de tâches que l'agent termine correctement.

En savoir plus
Exemple
Une tâche représentative : « trouver l'article le moins cher d'une catégorie et en ajouter deux au panier », que l'agent doit réaliser en naviguant, cliquant et saisissant du texte sur le site réel.
Notation
La métrique est le taux de réussite des tâches : le nombre de tâches accomplies divisé par le nombre total de tâches, exprimé en pourcentage.
Vérification
Chaque tâche est fournie avec un vérificateur programmatique qui contrôle le résultat automatiquement, soit en le comparant à la réponse attendue, soit en inspectant l'état final du site, de sorte que l'évaluation est faite par la machine et non par un humain.
Pourquoi c'est important
Il montre si les agents LLM peuvent réellement piloter de vrais sites web de bout en bout — un test plus difficile et plus concret que les tâches web à une seule étape ou synthétiques —, ce qui en fait une référence clé pour l'automatisation web par agents.
Exemple résolu
Tâche
Vous êtes un agent web autonome dans l'environnement GitLab auto-hébergé de WebArena : vous observez l'arbre d'accessibilité (accessibility tree) de la page et, à chaque étape, vous émettez une action de l'espace d'actions de WebArena (par exemple click [id], type [id] [text] [enter], goto [url], stop [answer]). Objectif : créer une nouvelle issue intitulée Bug: login button unresponsive dans le dépôt a11yproject/a11yproject.com et vous l'attribuer.
Solution
goto [http://gitlab.webarena/a11yproject/a11yproject.com/-/issues/new]
type [1023] [Bug: login button unresponsive] [0]
click [1187]        # open the Assignee dropdown
click [1203]        # choose "Assign to me"
click [1250]        # click the "Create issue" button
stop [N/A]
Explication
La trajectoire ouvre le formulaire de nouvelle issue, saisit le titre exact, se l'attribue via le menu d'assigné puis valide ; stop [N/A] termine l'épisode car la tâche modifie l'état au lieu de renvoyer une valeur. L'évaluateur program_html de WebArena recharge l'issue créée et vérifie le DOM de façon fonctionnelle — le titre égale la chaîne et l'assigné égale l'utilisateur connecté —, de sorte que les résultats approximatifs obtiennent 0.
0 19.5 39 58.5 78 2023-07-25 2025-01-26 2026-07-31 GPT-4-based agent · 14.4 · 2023-07-25 SteP · 33.5 · 2023-10-05 AWA 1.5 · 57.1 · 2024-08-08 AgentOccam · 9.8 · 2024-10-17 CUA · 58.1 · 2025-01-23 Surfer 2 · 69.6 · 2025-10-22 ColorBrowserAgent · 71.2 · 2026-01-12 GUI-Owl-1.5 · 48.4 · 2026-02-24 Qwen-UI-Agent · 73.6 · 2026-07-31
GPT-4-based agent SteP AWA 1.5 AgentOccam CUA Surfer 2 ColorBrowserAgent GUI-Owl-1.5 Qwen-UI-Agent
Chronologie
Date Modèle Score Source
2026-07-31 Qwen-UI-Agent 73.6% Qwen-UI-Agent établit un record sur les benchmarks d'utilisation mobile
2026-02-24 GUI-Owl-1.5 48.4% GUI-Owl-1.5 introduit des agents GUI fondamentaux multi-plateformes
2026-01-12 ColorBrowserAgent 71.2% ColorBrowserAgent introduit l'évolution adaptative des connaissances pour une automatisation web robuste sur le long terme
2025-10-22 Surfer 2 69.6% Surfer 2 atteint l'état de l'art pour l'utilisation d'ordinateur multiplateforme via l'observation visuelle
2025-01-23 CUA 58.1% OpenAI présente l'agent utilisant l'ordinateur (CUA) alimentant la prévisualisation de recherche d'Operator
2024-10-17 AgentOccam 9.8% AgentOccam aligne les espaces d'observation et d'action pour améliorer les performances des agents web basés sur les LLM
2024-08-08 AWA 1.5 57.14% AWA 1.5 atteint 57,14 % sur le benchmark WebArena
2023-10-05 SteP 33.5% SteP utilise des politiques LLM empilées pour améliorer les performances des tâches web
2023-07-25 GPT-4-based agent 14.41% WebArena : environnement web réaliste pour agents autonomes