Benchmark · agentic

Terminal-Bench

27 résultats 17 modèles

Terminal-Bench évalue dans quelle mesure les agents d'IA accomplissent de vraies tâches en ligne de commande dans un terminal, comme installer des logiciels, déboguer et effectuer des opérations système. Le score est le pourcentage de tâches que l'agent termine avec succès.

En savoir plus
Exemple
Une tâche typique donne à l'agent un environnement cassé ou vide et lui demande de le rendre fonctionnel — par exemple, installer les bonnes dépendances et corriger la configuration pour qu'un programme s'exécute, le tout via des commandes du terminal.
Notation
Chaque tâche est notée réussie ou échouée selon que l'agent a atteint l'état final requis, et le score du benchmark est le pourcentage de tâches résolues sur le total.
Vérification
Un résultat n'est accepté que si des vérifications automatiques dans un environnement isolé (sandbox) confirment que l'objectif visé de la tâche a été atteint — et non par des votes humains ni une correspondance exacte de texte.
Pourquoi c'est important
Les compétences en terminal — installer, déboguer et administrer des systèmes depuis la ligne de commande — sont au cœur du vrai travail d'ingénierie, donc ce benchmark montre si un agent peut agir de façon autonome et fiable dans une véritable ligne de commande. Sa version 2.x, plus difficile, maintient la barre haute à mesure que les agents progressent.
Exemple résolu
Tâche
Dans un conteneur Docker de Terminal-Bench, le fichier /app/access.log contient les journaux d'accès Apache. Écrivez une seule commande qui compte le nombre d'adresses IP client distinctes (le premier champ séparé par des espaces de chaque ligne) et enregistre uniquement ce nombre dans /app/answer.txt.
Solution
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Explication
awk affiche le premier champ (l'IP du client) de chaque ligne de journal, sort -u supprime les doublons et wc -l compte les IP uniques restantes, le résultat étant redirigé vers /app/answer.txt. Terminal-Bench l'évalue en exécutant dans le conteneur un test pytest qui lit /app/answer.txt et vérifie qu'il est égal au nombre connu d'IP uniques.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) RELAI-VCL Meta Harness GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
Chronologie
Date Modèle Score Source
2026-07-29 Kimi K2.6 73.0% Fireworks AI lance la couche de routage Fireworks Nexus pour le contrôle des coûts
2026-07-29 GPT-5.5 69.0% Fireworks AI lance la couche de routage Fireworks Nexus pour le contrôle des coûts
2026-07-29 Kimi K3 32.0% Fireworks AI lance la couche de routage Fireworks Nexus pour le contrôle des coûts
2026-07-16 baseline agent 58.7% L'optimisation des composés par RELAI-VCL obtient des gains sur Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% L'optimisation des composés par RELAI-VCL obtient des gains sur Terminal-Bench 2.0
2026-07-16 GEPA 66.0% L'optimisation des composés par RELAI-VCL obtient des gains sur Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% L'optimisation des composés par RELAI-VCL obtient des gains sur Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% RELAI-VCL amplifie les gains agent-optimiseur par l'apprentissage continu
2026-07-16 RELAI-VCL 76.4% RELAI-VCL amplifie les gains agent-optimiseur par l'apprentissage continu
2026-07-16 GEPA 66.0% RELAI-VCL amplifie les gains agent-optimiseur par l'apprentissage continu
2026-07-16 baseline agent 58.7% RELAI-VCL amplifie les gains agent-optimiseur par l'apprentissage continu
2026-07-16 RELAI-VCL 76.4% RELAI-VCL amplifie les gains de l'optimisation d'agents par apprentissage continu
2026-07-16 Meta Harness 64.6% RELAI-VCL amplifie les gains de l'optimisation d'agents par apprentissage continu
2026-07-16 GEPA 66.0% RELAI-VCL amplifie les gains de l'optimisation d'agents par apprentissage continu
2026-07-16 baseline agent 58.7% RELAI-VCL amplifie les gains de l'optimisation d'agents par apprentissage continu
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 en 4-bit sur 4× DGX Spark atteint 70,8 % sur Terminal-Bench 2.1
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI lance en version soft GPT-5.6 Sol avec un record de codage, mais reconnaît des problèmes de tricherie
2026-06-26 GPT-5.6 Sol 88.8% OpenAI lance en version soft GPT-5.6 Sol avec un record de codage, mais reconnaît des problèmes de tricherie
2026-03-27 Composer 2 61.7pts Cursor publie le rapport technique sur l'entraînement du modèle de codage agentique Composer 2
2026-02-05 Claude Opus 4.6 65.4% Anthropic lance Claude Opus 4.6 avec une fenêtre de contexte de 1M et des améliorations agentic
2025-11-25 Claude Opus 4.5 59.3% Anthropic lance Claude Opus 4.5 avec des capacités de codage et d'utilisation d'ordinateur de pointe
2025-09-30 GLM-4.6 40.5% Zhipu AI lance GLM-4.6 avec des capacités agentic et une fenêtre de contexte de 128k
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic lance Claude Sonnet 4.5 avec des capacités de codage et d'agent améliorées
2025-05-23 Claude Sonnet 4 35.5% Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
2025-05-23 Claude Opus 4 43.2% Anthropic publie Claude Opus 4 et Sonnet 4 avec raisonnement hybride
2025-05-22 Claude Opus 4 43.2% Anthropic présente Claude Opus 4 et Sonnet 4 avec réflexion étendue et utilisation d'outils
2025-05-22 Claude Opus 4 43.2% Anthropic publie Claude Opus 4 et Sonnet 4 avec des mesures de sécurité ASL-3