O Instituto de Segurança de IA do Reino Unido (AISI) disponibilizou publicamente métodos de avaliação e achados por meio da plataforma Evaluation Cards do EvalEval, visando melhorar a reprodutibilidade dos benchmarks. Esta divulgação inclui resultados verificados, contexto e informações de configuração para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.

  • Os dados abrangem seis modelos de ponta: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 e GPT-5.4.
  • Resultados adicionais de duas avaliações cibernéticas, Cyber CTFs e The Last Ones, estão incluídos usando um conjunto parcialmente sobreposto de modelos.
  • A divulgação acompanha o artigo do AISI sobre como o poder computacional de inferência molda a avaliação de LLMs de ponta, destacando que o desempenho no Humanity's Last Exam varia conforme o protocolo de avaliação e a contagem de tokens.

A divulgação aberta de resultados com informações de configuração permite que pesquisadores examinem os estudos detalhadamente, comparem achados em todo o ecossistema e entendam como as escolhas de configuração influenciam o desempenho relatado.