AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам
Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.