IntelligenceLab ha presentado una solicitud a Hugging Face para añadir el conjunto de datos Long-Horizon-Terminal-Bench (LHTB) a la lista permitida de benchmarks. El objetivo es permitir la agregación de los resultados de evaluación de la comunidad para este benchmark en Hugging Face Hub.
- LHTB consta de 46 tareas diseñadas para probar qué tan bien los agentes LLM mantienen un trabajo útil en una terminal contenerizada durante cientos de pasos.
- Utiliza verificadores ocultos que reconstruyen desde artefactos en lugar de progreso autoinformado para evaluar el rendimiento del agente.
- Las tareas se ejecutan a través del framework Harbor / Terminal-Bench 2.0, con un archivo eval.yaml ya presente y validado en el repositorio.