L'AISI publie des résultats d'évaluation vérifiés pour six modèles de pointe sur cinq benchmarks
L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.