L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.

  • Les données couvrent six modèles de pointe : Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 et GPT-5.4.
  • Des résultats supplémentaires provenant de deux évaluations cyber, Cyber CTFs et The Last Ones, sont inclus en utilisant un ensemble partiellement chevauchant de modèles.
  • Cette publication accompagne le document de l'AISI sur la manière dont le calcul d'inférence façonne l'évaluation des LLM de pointe, soulignant que les performances sur Humanity's Last Exam varient selon le protocole d'évaluation et le nombre de tokens.

La publication ouverte des résultats avec les informations de configuration permet aux chercheurs d'examiner attentivement les études, de comparer les conclusions à travers l'écosystème et de comprendre comment les choix de configuration influencent les performances rapportées.