AISI divulga resultados verificados de avaliação para seis modelos de ponta em cinco benchmarks
O Instituto de Segurança de IA do Reino Unido (AISI) disponibilizou publicamente métodos de avaliação e achados por meio da plataforma Evaluation Cards do EvalEval, visando melhorar a reprodutibilidade dos benchmarks. Esta divulgação inclui resultados verificados, contexto e informações de configuração para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.