Бенчмарк · agentic
Terminal-Bench
Terminal-Bench проверяет, насколько хорошо ИИ-агенты выполняют реальные задачи командной строки в терминале — установку программ, отладку и системные операции. Оценка — это процент задач, которые агент успешно выполнил.
Подробнее
- Пример
- Типичная задача даёт агенту сломанное или пустое окружение и просит привести его в рабочее состояние — например, установить нужные зависимости и исправить конфигурацию, чтобы программа запустилась, делая всё через команды терминала.
- Метрика
- Каждая задача оценивается как «пройдена» или «не пройдена» по тому, достиг ли агент требуемого конечного состояния, а итоговый балл — это процент решённых задач от общего числа.
- Приёмка
- Результат принимается только если автоматические проверки в изолированном (sandbox) окружении подтверждают, что нужный итог задачи достигнут, — без голосования людей или сверки точного текста.
- Почему важно
- Навыки работы в терминале — установка, отладка и управление системами из командной строки — ключевые в реальной инженерии, поэтому этот бенчмарк показывает, может ли агент действовать автономно и надёжно в настоящей командной строке. Более сложная версия 2.x поднимает планку по мере роста возможностей агентов.
Разбор примера
Задача
В Docker-контейнере Terminal-Bench файл /app/access.log содержит логи доступа Apache. Напишите одну команду, которая подсчитывает число уникальных клиентских IP-адресов (первое поле каждой строки, разделённое пробелами) и сохраняет только это число в /app/answer.txt.
Решение
awk '{print $1}' /app/access.log | sort -u | wc -l > /app/answer.txt
Разбор
awk выводит первое поле (IP клиента) каждой строки лога, sort -u убирает дубликаты, а wc -l считает оставшиеся уникальные IP, результат перенаправляется в /app/answer.txt. Terminal-Bench оценивает решение, запуская в контейнере pytest-тест, который читает /app/answer.txt и проверяет равенство известному числу уникальных IP.