IntelligenceLab 已向 Hugging Face 提交申请,要求将 Long-Horizon-Terminal-Bench (LHTB) 数据集加入基准测试白名单。目标是能够在 Hugging Face Hub 上聚合社区对该基准测试的评估结果。

  • LHTB 包含 46 项任务,旨在测试 LLM 代理在容器化终端中执行数百步操作时维持有用工作的能力。
  • 它使用基于工件重建的隐藏验证器,而非依赖自我报告进度来评估代理性能。
  • 任务通过 Harbor / Terminal-Bench 2.0 框架执行,仓库中已存在并验证了 eval.yaml 文件。