IntelligenceLab a soumis une demande à Hugging Face pour ajouter le jeu de données Long-Horizon-Terminal-Bench (LHTB) à la liste autorisée des benchmarks. L'objectif est de permettre l'agrégation des résultats d'évaluation de la communauté pour ce benchmark sur Hugging Face Hub.

  • LHTB comprend 46 tâches conçues pour tester dans quelle mesure les agents LLM maintiennent un travail utile dans un terminal conteneurisé sur plusieurs centaines d'étapes.
  • Il utilise des vérificateurs cachés reconstruits à partir d'artefacts plutôt que des progrès auto-déclarés pour évaluer la performance de l'agent.
  • Les tâches sont exécutées via le framework Harbor / Terminal-Bench 2.0, avec un fichier eval.yaml déjà présent et validé dans le dépôt.