A IntelligenceLab enviou um pedido à Hugging Face para adicionar o conjunto de dados Long-Horizon-Terminal-Bench (LHTB) à lista permitida de benchmarks. O objetivo é permitir a agregação dos resultados de avaliação da comunidade para este benchmark no Hugging Face Hub.
- O LHTB consiste em 46 tarefas projetadas para testar o quão bem os agentes LLM sustentam trabalho útil em um terminal contêinerizado ao longo de centenas de etapas.
- Ele utiliza verificadores ocultos que reconstruem a partir de artefatos, em vez de progresso auto-relatado, para avaliar o desempenho do agente.
- As tarefas são executadas por meio da estrutura Harbor / Terminal-Bench 2.0, com um arquivo eval.yaml já presente e validado no repositório.