Benchmark · agentic
Windows Agent Arena
Windows Agent Arena (WAA) est un benchmark reproductible qui évalue des agents d'IA multimodaux sur 154 tâches réelles réalisées dans un environnement Windows 11 en fonctionnement ; la métrique principale est le taux de réussite des tâches — la proportion de tâches que l'agent accomplit correctement.
En savoir plus
- Exemple
- Un type de tâche : piloter de vraies applications de bureau pour atteindre un état cible en utilisant uniquement des captures d'écran et l'arbre d'accessibilité (accessibility tree) — par exemple, modifier une option dans Windows Settings, éditer une feuille de calcul dans LibreOffice Calc, installer une extension dans VS Code ou accomplir une tâche de navigation dans Chrome.
- Notation
- Chaque tâche est fournie avec un script de récompense déterministe qui, à la fin de l'épisode, inspecte l'état final de la machine virtuelle (fichiers, valeurs de registre, sortie de l'application) et renvoie un score par tâche, généralement une réussite binaire (1/0). Le score du benchmark est le taux de réussite moyen sur l'ensemble des 154 tâches ; les exécutions complètes sont parallélisées sur des machines virtuelles Azure.
- Vérification
- Un résultat n'est compté que si le validateur intégré de la tâche confirme l'état final visé dans l'environnement réel, et non par correspondance avec le texte ou le journal d'actions de l'agent. L'agent dispose d'un budget fixe d'actions/étapes ; le dépasser ou laisser un état incorrect donne 0. Les exécutions sont reproductibles car l'image de la machine virtuelle et les configurations des tâches sont figées.
- Pourquoi c'est important
- Il teste si les agents peuvent réellement exploiter un système d'exploitation complet et réel — en naviguant dans les interfaces graphiques de nombreuses applications du quotidien — plutôt que de simplement répondre à des questions. Un écart important subsiste entre les agents actuels et les humains sans assistance, et l'infrastructure parallélisée sur Azure rend rapide l'évaluation reproductible et à grande échelle des agents de système d'exploitation.
Exemple résolu
Tâche
Élément représentatif (domaine Windows Settings) : « Basculer le mode de couleur des applications Windows sur Dark. » L'agent reçoit une capture d'écran et l'arbre d'accessibilité d'une machine virtuelle Windows 11 neuve et doit émettre des actions d'interface graphique (souris et clavier) pour y parvenir ; seul l'objectif est donné, sans texte cible.
Solution
Étapes : 1) Ouvrir Settings (Win+I, ou Start puis Settings). 2) Aller dans Personalization puis Colors. 3) Sous « Choose your mode », sélectionner Dark. État final : le thème des applications/du système est Dark (valeur de registre HKCU\...\Themes\Personalize\AppsUseLightTheme = 0).
Explication
C'est correct car l'objectif est un changement d'état et la séquence définit exactement la valeur que lit le validateur. Après l'épisode, le script de récompense interroge le registre de la machine virtuelle et renvoie success=1 uniquement si AppsUseLightTheme est égal à la valeur sombre (0), quelle que soit la manière dont l'agent y est parvenu.
| Date | Modèle | Score | Source |
|---|---|---|---|
| 2025-09-02 | UI-TARS-2 | 50.6% | UI-TARS-2 fait progresser les agents GUI grâce à l'apprentissage par renforcement multi-tours |