Бенчмарк · agentic

Terminal-Bench

28 результатов 18 моделей

Terminal-Bench проверяет, насколько хорошо ИИ-агенты выполняют реальные задачи командной строки в терминале — установку программ, отладку и системные операции. Оценка — это процент задач, которые агент успешно выполнил.

Подробнее
Пример
Типичная задача даёт агенту сломанное или пустое окружение и просит привести его в рабочее состояние — например, установить нужные зависимости и исправить конфигурацию, чтобы программа запустилась, делая всё через команды терминала.
Метрика
Каждая задача оценивается как «пройдена» или «не пройдена» по тому, достиг ли агент требуемого конечного состояния, а итоговый балл — это процент решённых задач от общего числа.
Приёмка
Результат принимается только если автоматические проверки в изолированном (sandbox) окружении подтверждают, что нужный итог задачи достигнут, — без голосования людей или сверки точного текста.
Почему важно
Навыки работы в терминале — установка, отладка и управление системами из командной строки — ключевые в реальной инженерии, поэтому этот бенчмарк показывает, может ли агент действовать автономно и надёжно в настоящей командной строке. Более сложная версия 2.x поднимает планку по мере роста возможностей агентов.
Разбор примера
Задача
В Docker-контейнере Terminal-Bench файл /app/access.log содержит логи доступа Apache. Напишите одну команду, которая подсчитывает число уникальных клиентских IP-адресов (первое поле каждой строки, разделённое пробелами) и сохраняет только это число в /app/answer.txt.
Решение
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Разбор
awk выводит первое поле (IP клиента) каждой строки лога, sort -u убирает дубликаты, а wc -l считает оставшиеся уникальные IP, результат перенаправляется в /app/answer.txt. Terminal-Bench оценивает решение, запуская в контейнере pytest-тест, который читает /app/answer.txt и проверяет равенство известному числу уникальных IP.
0 24.5 49 73.5 98 2025-05-22 2025-12-24 2026-07-29 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-22 Claude Opus 4 · 43.2 · 2025-05-23 Claude Sonnet 4 · 35.5 · 2025-05-23 GLM-4.6 · 40.5 · 2025-09-30 Claude Sonnet 4.5 · 50 · 2025-09-30 Claude Opus 4.5 · 59.3 · 2025-11-25 Claude Opus 4.6 · 65.4 · 2026-02-05 Composer 2 · 61.7 · 2026-03-27 GLM-5.2 · 80 · 2026-06-16 GPT-5.6 Sol (ultra mode) · 91.9 · 2026-06-26 GPT-5.6 Sol · 88.8 · 2026-06-26 GLM-5.2 (753B MoE) · 70.8 · 2026-07-08 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 Meta Harness · 64.6 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 RELAI-VCL · 76.4 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 GEPA · 66 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 baseline agent · 58.7 · 2026-07-16 Kimi K2.6 · 73 · 2026-07-29 GPT-5.5 · 69 · 2026-07-29 Kimi K3 · 32 · 2026-07-29
Claude Opus 4 Claude Sonnet 4 GLM-4.6 Claude Sonnet 4.5 Claude Opus 4.5 Claude Opus 4.6 Composer 2 GLM-5.2 GPT-5.6 Sol (ultra mode) GPT-5.6 Sol GLM-5.2 (753B MoE) Meta Harness RELAI-VCL GEPA baseline agent Kimi K2.6 GPT-5.5 Kimi K3
Хронология
Дата Модель Результат Источник
2026-07-29 Kimi K2.6 73.0% Fireworks AI выпустила слой маршрутизации Fireworks Nexus для контроля затрат
2026-07-29 GPT-5.5 69.0% Fireworks AI выпустила слой маршрутизации Fireworks Nexus для контроля затрат
2026-07-29 Kimi K3 32.0% Fireworks AI выпустила слой маршрутизации Fireworks Nexus для контроля затрат
2026-07-16 baseline agent 58.7% Оптимизация RELAI-VCL показывает лучшие результаты на Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% Оптимизация RELAI-VCL показывает лучшие результаты на Terminal-Bench 2.0
2026-07-16 GEPA 66.0% Оптимизация RELAI-VCL показывает лучшие результаты на Terminal-Bench 2.0
2026-07-16 RELAI-VCL 76.4% Оптимизация RELAI-VCL показывает лучшие результаты на Terminal-Bench 2.0
2026-07-16 Meta Harness 64.6% RELAI-VCL усиливает преимущества агента-оптимизатора за счёт непрерывного обучения
2026-07-16 RELAI-VCL 76.4% RELAI-VCL усиливает преимущества агента-оптимизатора за счёт непрерывного обучения
2026-07-16 GEPA 66.0% RELAI-VCL усиливает преимущества агента-оптимизатора за счёт непрерывного обучения
2026-07-16 baseline agent 58.7% RELAI-VCL усиливает преимущества агента-оптимизатора за счёт непрерывного обучения
2026-07-16 Meta Harness 64.6% RELAI-VCL усиливает эффект накопления преимуществ агента-оптимизатора за счёт непрерывного обучения
2026-07-16 RELAI-VCL 76.4% RELAI-VCL усиливает эффект накопления преимуществ агента-оптимизатора за счёт непрерывного обучения
2026-07-16 GEPA 66.0% RELAI-VCL усиливает эффект накопления преимуществ агента-оптимизатора за счёт непрерывного обучения
2026-07-16 baseline agent 58.7% RELAI-VCL усиливает эффект накопления преимуществ агента-оптимизатора за счёт непрерывного обучения
2026-07-08 GLM-5.2 (753B MoE) 70.8% GLM-5.2 в 4-битном формате на 4× DGX Spark достигает 70,8% в Terminal-Bench 2.1
2026-06-26 GPT-5.6 Sol (ultra mode) 91.9% OpenAI в тестовом режиме представила GPT-5.6 Sol с рекордом в программировании, но признала проблемы с мошенничеством
2026-06-26 GPT-5.6 Sol 88.8% OpenAI в тестовом режиме представила GPT-5.6 Sol с рекордом в программировании, но признала проблемы с мошенничеством
2026-06-16 GLM-5.2 80.0% GLM-5.2 превышает 80% на Terminal-Bench
2026-03-27 Composer 2 61.7pts Cursor опубликовал технический отчёт по обучению агентной модели Composer 2
2026-02-05 Claude Opus 4.6 65.4% Anthropic выпустила Claude Opus 4.6 с контекстным окном на 1M токенов и улучшениями для агентов
2025-11-25 Claude Opus 4.5 59.3% Anthropic выпустила Claude Opus 4.5 с передовыми возможностями программирования и управления компьютером
2025-09-30 GLM-4.6 40.5% Zhipu AI выпустила GLM-4.6 с агентными возможностями и контекстным окном на 128k токенов
2025-09-30 Claude Sonnet 4.5 50.0% Anthropic выпустила Claude Sonnet 4.5 с улучшенными возможностями программирования и агентов
2025-05-23 Claude Opus 4 43.2% Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
2025-05-23 Claude Sonnet 4 35.5% Anthropic выпустила Claude Opus 4 и Sonnet 4 с гибридным рассуждением
2025-05-22 Claude Opus 4 43.2% Anthropic выпустила Claude Opus 4 и Sonnet 4 с мерами безопасности ASL-3
2025-05-22 Claude Opus 4 43.2% Anthropic представляет Claude Opus 4 и Sonnet 4 с расширенным мышлением и использованием инструментов