Benchmark · agentic

Terminal-Bench

28 resultados 18 modelos

Terminal-Bench evalúa qué tan bien los agentes de IA completan tareas reales de línea de comandos en una terminal, como instalar software, depurar y realizar operaciones del sistema. La puntuación es el porcentaje de tareas que el agente termina con éxito.

Leer más
Ejemplo
Una tarea típica le da al agente un entorno roto o vacío y le pide llevarlo a un estado funcional; por ejemplo, instalar las dependencias correctas y corregir la configuración para que un programa se ejecute, todo mediante comandos de la terminal.
Puntuación
Cada tarea se califica como aprobada o fallida según si el agente alcanzó el estado final requerido, y la puntuación del benchmark es el porcentaje de tareas resueltas sobre el total.
Verificación
Un resultado solo se acepta si comprobaciones automáticas dentro de un entorno aislado (sandbox) confirman que se logró el objetivo previsto de la tarea, no por votos humanos ni por coincidencia exacta de texto.
Por qué importa
Las habilidades de terminal —instalar, depurar y operar sistemas desde la línea de comandos— son centrales en el trabajo real de ingeniería, así que este benchmark muestra si un agente puede actuar de forma autónoma y fiable en una línea de comandos real. Su versión 2.x, más difícil, mantiene el listón alto a medida que los agentes mejoran.
Ejemplo resuelto
Tarea
En un contenedor Docker de Terminal-Bench, el archivo /app/access.log contiene registros de acceso de Apache. Escribe un único comando que cuente el número de direcciones IP de cliente distintas (el primer campo separado por espacios de cada línea) y guarde solo ese número en /app/answer.txt.
Solución
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Explicación
awk imprime el primer campo (la IP del cliente) de cada línea del log, sort -u elimina duplicados y wc -l cuenta las IP únicas restantes, redirigiendo el resultado a /app/answer.txt. Terminal-Bench lo califica ejecutando en el contenedor un test de pytest que lee /app/answer.txt y comprueba que es igual al número conocido de IP únicas.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 · 80 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 GLM-5.2 (753B MoE) baseline agent GEPA RELAI-VCL Meta Harness Kimi K2.6 GPT-5.5 Kimi K3
Cronología
Fecha Modelo Puntuación Fuente
2026-07-29 Kimi K2.6 73.0% Fireworks AI lanza la capa de enrutamiento Fireworks Nexus para el control de costos
2026-07-29 GPT-5.5 69.0% Fireworks AI lanza la capa de enrutamiento Fireworks Nexus para el control de costos
2026-07-29 Kimi K3 32.0% Fireworks AI lanza la capa de enrutamiento Fireworks Nexus para el control de costos
2026-07-16 baseline agent 58.7% La optimización de RELAI-VCL obtiene ventajas en Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% La optimización de RELAI-VCL obtiene ventajas en Terminal-Bench 2.0
2026-07-16 GEPA 66.0% La optimización de RELAI-VCL obtiene ventajas en Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% La optimización de RELAI-VCL obtiene ventajas en Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% RELAI-VCL compuesta ganancias de agente-optimizador mediante aprendizaje continuo
2026-07-16 RELAI-VCL 76.4% RELAI-VCL compuesta ganancias de agente-optimizador mediante aprendizaje continuo
2026-07-16 GEPA 66.0% RELAI-VCL compuesta ganancias de agente-optimizador mediante aprendizaje continuo
2026-07-16 baseline agent 58.7% RELAI-VCL compuesta ganancias de agente-optimizador mediante aprendizaje continuo
2026-07-16 baseline agent 58.7% RELAI-VCL compuesta las ganancias del agente-optimizador mediante aprendizaje continuo
2026-07-16 GEPA 66.0% RELAI-VCL compuesta las ganancias del agente-optimizador mediante aprendizaje continuo
2026-07-16 RELAI-VCL 76.4% RELAI-VCL compuesta las ganancias del agente-optimizador mediante aprendizaje continuo
2026-07-16 Meta Harness 64.6% RELAI-VCL compuesta las ganancias del agente-optimizador mediante aprendizaje continuo
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 en 4 bits en 4× DGX Spark alcanza 70,8% en Terminal-Bench 2.1
2026-06-26 GLM-5.2 80.0% GLM-5.2 supera el 80% en Terminal-Bench
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI lanza en modo beta GPT-5.6 Sol con récord de codificación pero reconoce problemas de engaño
2026-06-26 GPT-5.6 Sol 88.8% OpenAI lanza en modo beta GPT-5.6 Sol con récord de codificación pero reconoce problemas de engaño
2026-03-27 Composer 2 61.7pts Cursor publica informe técnico sobre el entrenamiento del modelo de codificación agéntica Composer 2
2026-02-05 Claude Opus 4.6 65.4% Anthropic lanza Claude Opus 4.6 con ventana de contexto de 1M y mejoras agénticas
2025-11-25 Claude Opus 4.5 59.3% Anthropic lanza Claude Opus 4.5 con codificación y uso de computadora de última generación
2025-09-30 GLM-4.6 40.5% Zhipu AI lanza GLM-4.6 con capacidades agénticas y ventana de contexto de 128k
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic lanza Claude Sonnet 4.5 con capacidades mejoradas de codificación y agentes
2025-05-23 Claude Sonnet 4 35.5% Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
2025-05-23 Claude Opus 4 43.2% Anthropic lanza Claude Opus 4 y Sonnet 4 con razonamiento híbrido
2025-05-22 Claude Opus 4 43.2% Anthropic presenta Claude Opus 4 y Sonnet 4 con pensamiento extendido y uso de herramientas
2025-05-22 Claude Opus 4 43.2% Anthropic lanza Claude Opus 4 y Sonnet 4 con medidas de seguridad ASL-3