IntelligenceLab telah mengajukan permintaan kepada Hugging Face untuk menambahkan dataset Long-Horizon-Terminal-Bench (LHTB) ke daftar izin benchmark. Tujuannya adalah memungkinkan agregasi hasil evaluasi komunitas untuk benchmark ini di Hugging Face Hub.

  • LHTB terdiri dari 46 tugas yang dirancang untuk menguji seberapa baik agen LLM mempertahankan pekerjaan yang berguna dalam terminal terkontainerisasi selama ratusan langkah.
  • Ini memanfaatkan pemverifikasi tersembunyi yang dibangun ulang dari artefak alih-alih kemajuan yang dilaporkan sendiri untuk menilai kinerja agen.
  • Tugas-tugas dijalankan melalui harness Harbor / Terminal-Bench 2.0, dengan file eval.yaml sudah ada dan tervalidasi di repositori.