Компания IntelligenceLab подала запрос в Hugging Face на включение набора данных Long-Horizon-Terminal-Bench (LHTB) в разрешённый список бенчмарков. Цель — обеспечить агрегацию результатов оценки сообщества для этого бенчмарка на платформе Hugging Face Hub.

  • LHTB состоит из 46 задач, предназначенных для проверки того, насколько хорошо агенты LLM поддерживают полезную работу в контейнеризованном терминале на протяжении сотен шагов.
  • Для оценки производительности агентов используются скрытые верификаторы, восстанавливающие данные из артефактов, а не самоотчёты о прогрессе.
  • Задачи выполняются с помощью фреймворка Harbor / Terminal-Bench 2.0; в репозитории уже присутствует и проверен файл eval.yaml.