Бенчмарк · agentic

Terminal-Bench 2

15 результатов 12 моделей

Harbor/Terminus-2 89-task terminal-agent suite; 2.0 and 2.1 are the same task set, so one series. File here only when the quote says 2.0 / 2.1 / v2 — not the original suite (terminal-bench), and not the harder 'Terminal-Bench Hard' subset (not in this catalog).

0 23 46 69 92 2025-11-19 2026-03-21 2026-07-21 GPT-5.1-Codex-Max · 58.1 · 2025-11-19 Step 3.5 Flash · 51 · 2026-02-10 MiniMax M2.7 · 57 · 2026-04-12 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-23 GPT-5.5 · 82.7 · 2026-04-25 Qwen3.6-27B · 59.3 · 2026-04-25 Tmax · 27 · 2026-06-23 Tmax-27B · 43 · 2026-06-23 GLM 5.2 FP8 with FP8 KV · 79.8 · 2026-07-05 LLM-as-a-Verifier · 86.5 · 2026-07-07 Grok 4.5 · 83.3 · 2026-07-08 hermes · 55 · 2026-07-08 Gemini 3.5 Flash-Lite · 54 · 2026-07-21 Gemini 3.5 Flash-Lite · 54 · 2026-07-21
GPT-5.1-Codex-Max Step 3.5 Flash MiniMax M2.7 GPT-5.5 Qwen3.6-27B Tmax Tmax-27B GLM 5.2 FP8 with FP8 KV LLM-as-a-Verifier Grok 4.5 hermes Gemini 3.5 Flash-Lite
Хронология
Дата Модель Результат Источник
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber для агентных рабочих нагрузок
2026-07-21 Gemini 3.5 Flash-Lite 54.0% Google выпустила Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
2026-07-08 hermes 55.0% Пользователи сравнивают Mimo v2.5 с DeepSeek V4 Flash и Hermes
2026-07-08 Grok 4.5 83.3% xAI выпустила Grok 4.5 с низкой стоимостью и смешанными результатами бенчмарков
2026-07-07 LLM-as-a-Verifier 86.5% LLM-as-a-Verifier представляет общую систему верификации с непрерывным оцениванием
2026-07-05 GLM 5.2 FP8 with FP8 KV 79.8% GLM 5.2 FP8 с FP8 KV достигает 79,8% в Terminal-Bench 2.1
2026-06-23 Tmax-27B 43.0% Агент Tmax-27B для малых видеокарт с обучением DPPO
2026-06-23 Tmax 27.0% Tmax: Простая рецептура RL для агентов-конечных
2026-04-25 Qwen3.6-27B 59.3% Alibaba выпустила Qwen3.6-27B, превосходящую более крупного предшественника на бенчмарках по программированию
2026-04-25 GPT-5.5 82.7% OpenAI выпустила GPT-5.5: модель с нуля переобученная для нативной омнимодальной обработки
2026-04-23 GPT-5.5 82.7% OpenAI выпустила GPT-5.5 с агентными возможностями и удвоенной ценой API
2026-04-23 GPT-5.5 82.7% OpenAI выпустила GPT-5.5 и GPT-5.5 Pro через API
2026-04-12 MiniMax M2.7 57.0% MiniMax открыл исходный код M2.7, самообучающейся модели MoE, показавшей 56.22% на SWE-Pro
2026-02-10 Step 3.5 Flash 51.0% Шаг 3.5 Flash: открытая MoE-модель с 11B активных параметров достигает уровня передовых агентов
2025-11-19 GPT-5.1-Codex-Max 58.1% OpenAI делает GPT-5.1-Codex-Max моделью по умолчанию в Codex CLI