El Instituto de Seguridad de IA del Reino Unido (AISI) ha puesto a disposición pública los métodos de evaluación y los hallazgos reportados a través de la plataforma Evaluation Cards de EvalEval para mejorar la reproducibilidad de los benchmarks. Esta publicación incluye resultados verificados, contexto e información de configuración para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0.
- Los datos cubren seis modelos de vanguardia: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 y GPT-5.4.
- Se incluyen resultados adicionales de dos evaluaciones cibernéticas, Cyber CTFs y The Last Ones, utilizando un conjunto parcialmente superpuesto de modelos.
- La publicación acompaña al documento de AISI sobre cómo el cómputo de inferencia moldea la evaluación de LLMs de vanguardia, destacando que el rendimiento en Humanity's Last Exam cambia según el protocolo de evaluación y el número de tokens.
La publicación abierta de resultados con información de configuración permite a los investigadores examinar los estudios de cerca, comparar hallazgos en todo el ecosistema y comprender cómo las decisiones de configuración influyen en el rendimiento reportado.