Benchmark · agentic
AgentBench
AgentBench évalue les LLM comme agents interactifs dans 8 environnements distincts (tâches de code, de jeu et de web), en mesurant la prise de décision multi-tours ; chaque environnement produit son propre score, combinés en un unique Overall Score pondéré.
En savoir plus
- Exemple
- Tâche de l'environnement « Système d'exploitation » : on donne à l'agent un objectif en langage naturel (par exemple compter les fichiers qui remplissent une condition ou modifier les permissions d'un fichier), et il saisit des commandes bash tour après tour, lit chaque sortie, puis envoie une réponse finale ou laisse le shell dans l'état requis.
- Notation
- Chaque environnement utilise sa propre métrique : taux de réussite (OS, DB, House-Holding), F1 (graphe de connaissances), récompense moyenne (Web Shopping), précision d'étape/d'élément (navigation web) ou progression/récompense de jeu (jeu de cartes, énigmes). L'Overall Score principal est une moyenne pondérée des huit scores, avec des poids choisis pour équilibrer la difficulté afin qu'aucune tâche facile ne domine.
- Vérification
- Chaque tâche s'exécute dans un environnement exécutable doté d'un vérificateur automatique et déterministe : la trajectoire multi-tours de l'agent est validée par programme (par exemple un script qui vérifie le shell, l'état final de la base de données, la récompense de WebShop ou la correspondance avec les actions de référence). Aucun juge humain ; les interactions ont un nombre maximal de tours, et dépasser la limite ou émettre une action invalide compte comme un échec.
- Pourquoi c'est important
- Ce fut l'un des premiers bancs d'essai standardisés à tester les LLM comme agents plutôt que comme répondeurs à un seul tour, sollicitant le raisonnement à long horizon, l'usage d'outils et la récupération d'erreurs ; il a révélé un large écart entre les meilleurs modèles commerciaux d'API et les modèles open source sur des tâches agentiques réelles.
Exemple résolu
Tâche
Environnement « Système d'exploitation ». Dans un shell bash Ubuntu, on dit à l'agent : « Combien de comptes utilisateurs de ce système ont /bin/bash comme shell de connexion ? Donnez le nombre. » Il peut exécuter plusieurs commandes du shell sur plusieurs tours avant de répondre.
Solution
grep -c ':/bin/bash$' /etc/passwd
Explication
Le septième champ (séparé par des deux-points) de chaque ligne de /etc/passwd est le shell de connexion ; compter les lignes se terminant par :/bin/bash donne donc le nombre de comptes avec bash. L'agent lit ce nombre dans la sortie de la commande et le renvoie via l'action
answer(N) de l'environnement. Notation : le vérificateur OS exécute un script de contrôle et note la soumission comme un succès/échec binaire.Aucun score vérifié pour ce benchmark à ce jour.