Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.
- Данные охватывают шесть передовых моделей: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 и GPT-5.4.
- Включены дополнительные результаты двух кибероценок: Cyber CTFs и The Last Ones, с использованием частично пересекающегося набора моделей.
- Выпуск сопровождается статьёй AISI о том, как вычислительные ресурсы при инференсе влияют на оценку передовых LLM, подчёркивая, что результаты на Humanity's Last Exam меняются в зависимости от протокола оценки и количества токенов.
Открытая публикация результатов с информацией об окружении позволяет исследователям внимательно изучать работы, сравнивать выводы по всей экосистеме и понимать, как выбор настроек влияет на заявленные показатели.