Les chercheurs ont présenté WebArena, un environnement hautement réaliste et reproductible conçu pour construire et tester des agents autonomes guidés par le langage. Contrairement aux environnements synthétiques précédents, cette plateforme propose des sites web entièrement fonctionnels dans quatre domaines courants : le commerce électronique, les forums sociaux, le développement collaboratif de logiciels et la gestion de contenu.

  • L'environnement inclut des outils tels que des cartes et des bases de connaissances externes pour encourager la résolution de tâches similaire à l'humain.
  • Un benchmark composé de tâches diverses et à long terme est publié pour évaluer la correction fonctionnelle des réalisations de l'agent.
  • Les expériences de base montrent que le meilleur agent basé sur GPT-4 atteint seulement un taux de réussite de 14,41 % en bout de chaîne.
  • Cette performance est nettement inférieure à celle des humains, qui se situe à 78,24 %.

Les résultats soulignent que les modèles de langage actuels les plus avancés sont loin d'être parfaits dans les tâches de la vie réelle et démontrent l'utilité de WebArena pour mesurer les progrès futurs.