Benchmark · agentic

Terminal-Bench 2

42 resultados 33 modelos

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 25 50 75 100 2025-11-19 2026-04-15 2026-09-10 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Qwen3.6-27B · 60.7 · 2026-08-10 Tmax · 27 · 2026-06-27 Tmax-27B · 43 · 2026-06-27 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-27 KAT-Coder-V2.5 · 60.7 · 2026-07-26 DeepSeek-V4-Flash · 82.7 · 2026-07-31 DeepSeek-V4-Flash · 79 · 2026-08-01 DeepSeek-V4-Flash-0731 · 82.7 · 2026-07-31 DeepSeek-V4-Flash-0731 · 82.7 · 2026-08-07 V4 Flash 0731 · 79 · 2026-08-01 Inkling-Small · 64.7 · 2026-08-03 Qwen3.8-Max · 86.6 · 2026-08-03 Qwen3.8-Max · 67.4 · 2026-08-05 Muse Spark 1.1 · 80 · 2026-08-05 Pokee-Isaac 28B · 65.1 · 2026-08-08 DeepSeek V4 Flash 0731 · 82.7 · 2026-08-09 Opus 5 · 86.7 · 2026-08-11 Grok 4.6 · 88.4 · 2026-08-13 Grok 4.6 · 88.4 · 2026-08-21 DeepSeek-V4-Pro · 87.9 · 2026-08-13 Ornith-1.5 · 86.1 · 2026-08-19 agents · 94 · 2026-08-20 DeepSeek-V4-Flash-Vision-Exp · 83.9 · 2026-08-21 Granite 4.2 30B · 29.2 · 2026-08-26 Granite 4.2 8B · 20.6 · 2026-08-26 Muse Spark 1.3 · 88.8 · 2026-09-04 K2-Horizon-MoVA-36B-A4B · 58.6 · 2026-09-07 K2-Horizon-375B-A23B · 66.9 · 2026-09-07 DeepSeek-V4.1-Flash · 90.6 · 2026-09-10
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B Tmax Tmax-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite KAT-Coder-V2.5 DeepSeek-V4-Flash DeepSeek-V4-Flash-0731 V4 Flash 0731 Inkling-Small Qwen3.8-Max Muse Spark 1.1 Pokee-Isaac 28B DeepSeek V4 Flash 0731 Opus 5 Grok 4.6 DeepSeek-V4-Pro Ornith-1.5 agents DeepSeek-V4-Flash-Vision-Exp Granite 4.2 30B Granite 4.2 8B Muse Spark 1.3 K2-Horizon-MoVA-36B-A4B K2-Horizon-375B-A23B DeepSeek-V4.1-Flash
Cronología
Fecha Modelo Puntuación Fuente
2026-09-10 DeepSeek-V4.1-Flash 90.6% DeepSeek lanza el modelo V4.1-Flash con soporte multimodal nativo
2026-09-07 K2-Horizon-MoVA-36B-A4B 58.6% IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
2026-09-07 K2-Horizon-375B-A23B 66.9% IFM lanza K2 Horizon: seis modelos Apache 2.0 de 0.9B a 375B
2026-09-04 Muse Spark 1.3 88.8% Meta lanza Muse Spark 1.3 con menos llamadas a herramientas y tokens
2026-08-26 Granite 4.2 30B 29.24% IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
2026-08-26 Granite 4.2 8B 20.56% IBM lanza Granite 4.2 con razonamiento nativo y RL agéntico para modelos empresariales abiertos
2026-08-21 Grok 4.6 88.4% SpaceXAI presenta Grok 4.6 con datos de Cursor para trabajo agéntico
2026-08-21 DeepSeek-V4-Flash-Vision-Exp 83.9% DeepSeek lanza el modelo multimodal DeepSeek-V4-Flash-Vision-Exp
2026-08-20 agents 94.0% Meta lanza Muse Video con audio nativo; Stripe adquiere OpenRouter
2026-08-19 Ornith-1.5 86.1% Ornith-1.5 lanza modelos de 9B, 35B-A3B y 397B con entrenamiento de auto-mejora
2026-08-13 DeepSeek-V4-Pro 87.9% El lanzamiento GA de DeepSeek-V4-Pro mejora las capacidades del agente y añade soporte para la API de Respuestas
2026-08-13 Grok 4.6 88.4% xAI lanza Grok 4.6; Alibaba abre Qwen3.8-MoE; DeepSeek V4 Pro GA
2026-08-11 Opus 5 86.74% El agente auto-desarrollador Ouroboros establece nuevos récords con Opus 5
2026-08-10 Qwen3.6-27B 60.7% Meta lanza Muse Glimmer, un modelo agente de pesos abiertos de 30B que funciona en una GPU para consumidores
2026-08-09 DeepSeek V4 Flash 0731 82.7% DeepSeek V4 Flash 0731 alcanza el 82.7% en Terminal-Bench 2.1 con un arnés público
2026-08-08 Pokee-Isaac 28B 65.1% Pokee AI lanza Pokee-Isaac 28B, un modelo de contexto de 10M tokens para despliegue en límites definidos
2026-08-07 DeepSeek-V4-Flash-0731 82.7% DeepSeek lanza V4-Flash-0731, superando a V4-Pro a menor costo
2026-08-05 Muse Spark 1.1 80.0% Meta lanza la versión beta de Muse Code, un agente terminal impulsado por Muse Spark 1.2
2026-08-05 Qwen3.8-Max 67.4% Alibaba anuncia Qwen3.8-Max con 2.4T parámetros y pesos abiertos próximamente
2026-08-03 Qwen3.8-Max 86.6% Alibaba lanza Qwen3.8-Max, un modelo MoE de 2.4T parámetros
2026-08-03 Inkling-Small 64.7% Thinking Machines Lab lanza Inkling-Small, un modelo MoE multimodal de pesos abiertos con 276B
2026-08-01 V4 Flash 0731 79.0% DeepSeek lanza V4-Flash con importantes mejoras post-entrenamiento y pesos abiertos
2026-08-01 DeepSeek-V4-Flash 79.0% DeepSeek lanza V4-Flash con mejoras post-entrenamiento y pesos abiertos
2026-07-31 DeepSeek-V4-Flash-0731 82.7% DeepSeek lanza V4-Flash-0731 con importantes mejoras agénticas a menor costo
2026-07-31 DeepSeek-V4-Flash 82.7% DeepSeek lanza la versión beta pública de DeepSeek-V4-Flash con capacidades mejoradas de agente
2026-07-27 Gemini 3.5 Flash-Lite 54.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-26 KAT-Coder-V2.5 60.7% KwaiKAT lanza KAT-Coder-V2.5, un modelo de codificación agente entrenado en más de 100.000 entornos verificables
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber para cargas de trabajo agénticas
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google lanza Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber
2026-07-08 hermes 55.0% Los usuarios comparan Mimo v2.5 con DeepSeek V4 Flash y Hermes
2026-07-08 Grok 4.5 83.3% xAI lanza Grok 4.5 con bajo costo y rendimiento mixto en benchmarks
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier presenta un marco de verificación de propósito general con puntuación continua
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 con KV FP8 alcanza 79,8% en Terminal-Bench 2.1
2026-06-27 Tmax-27B 43.0% Tmax-27B Agente Terminal para GPUs Pequeñas con Entrenamiento DPPO
2026-06-27 Tmax 27.0% Tmax: Una receta RL sencilla para agentes terminales
2026-04-25 Qwen3.6-27B 59.3% Alibaba lanza Qwen3.6-27B, superando al predecesor más grande en benchmarks de programación
2026-04-25 GPT-5.5 82.7% OpenAI lanza GPT-5.5, un modelo reentrenado desde cero con procesamiento omnimodal nativo
2026-04-23 GPT-5.5 82.7% OpenAI lanza GPT-5.5 con capacidades agénticas y duplica los precios de la API
2026-04-23 GPT-5.5 82.7% OpenAI lanza GPT-5.5 y GPT-5.5 Pro en la API
2026-04-12 MiniMax M2.7 57.0% MiniMax abre el código fuente de M2.7, un modelo MoE autoevolutivo que obtiene 56.22% en SWE-Pro
2026-02-10 Step 3.5 Flash 51.0% Paso 3.5 Flash: modelo MoE abierto con 11B activos alcanza rendimiento de agente de nivel fronterizo
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI establece GPT-5.1-Codex-Max como predeterminado en Codex CLI