IntelligenceLabは、Hugging Faceに対してLong-Horizon-Terminal-Bench (LHTB) データセットをベンチマークの許可リストに追加するよう申請しました。この目的は、Hugging Face Hub上でこのベンチマークに関するコミュニティの評価結果を集約できるようにすることです。
- LHTBは、LLMエージェントがコンテナ化されたターミナル内で数百ステップにわたって有用な作業を維持できるかをテストするために設計された46のタスクで構成されています。
- エージェントのパフォーマンスを評価するために、自己報告された進捗ではなく、アーティファクトから再構築される隠れた検証者を使用しています。
- タスクはHarbor / Terminal-Bench 2.0 ハーネスを通じて実行され、リポジトリにはすでにeval.yamlファイルが存在し、検証済みです。