IntelligenceLab telah mengajukan permintaan kepada Hugging Face untuk menambahkan dataset Long-Horizon-Terminal-Bench (LHTB) ke daftar izin benchmark. Tujuannya adalah memungkinkan agregasi hasil evaluasi komunitas untuk benchmark ini di Hugging Face Hub.
- LHTB terdiri dari 46 tugas yang dirancang untuk menguji seberapa baik agen LLM mempertahankan pekerjaan yang berguna dalam terminal terkontainerisasi selama ratusan langkah.
- Ini memanfaatkan pemverifikasi tersembunyi yang dibangun ulang dari artefak alih-alih kemajuan yang dilaporkan sendiri untuk menilai kinerja agen.
- Tugas-tugas dijalankan melalui harness Harbor / Terminal-Bench 2.0, dengan file eval.yaml sudah ada dan tervalidasi di repositori.