IntelligenceLab은 Hugging Face에 Long-Horizon-Terminal-Bench (LHTB) 데이터셋을 벤치마크 허용 목록에 추가해 달라고 요청했습니다. 목표는 Hugging Face Hub에서 이 벤치마크에 대한 커뮤니티 평가 결과를 집계하는 것입니다.

  • LHTB는 수백 단계에 걸쳐 컨테이너화된 터미널에서 유용한 작업을 잘 유지하는지 테스트하도록 설계된 46개의 작업으로 구성됩니다.
  • 에이전트 성능을 평가하기 위해 자기 보고식 진행 상황 대신 아티팩트에서 재구성되는 숨겨진 검증자를 사용합니다.
  • 작업은 Harbor / Terminal-Bench 2.0 하네스를 통해 실행되며, 저장소에는 이미 eval.yaml 파일이 존재하고 검증되었습니다.