Terminal Bench 4.0 a été publié, mettant à jour le benchmark pour suivre les nouvelles sorties de modèles et combattre la saturation des benchmarks.
- La mise à jour inclut des données de performance montrant que GLM-5.3 est au même niveau que Fable 5, marge d'erreur incluse.
- L'annonce met l'accent sur l'itération rapide de TerminalBench pour maintenir la pertinence face aux modèles émergents.
- La discussion de la communauté souligne le coût computationnel élevé des grands benchmarks, notant qu'ils nécessitent 5-10B tokens par exécution.