В статье представлен EvalAudit — исполняемый артефакт, предназначенный для определения того, сохраняется ли вывод бенчмарка (например, победитель или полный рейтинг) в рамках заявленного семейства спецификаций оценщика. Фиксируя оцениваемые системы и данные, но варьируя метрики и правила агрегации, инструмент вычисляет, остаётся ли множество возможных утверждений единственным.

Авторы применили EvalAudit к трём гетерогенным бенчмаркам: AgentDojo v0.1.35, AutoML Benchmark и BEIR SciFact. Результаты показали, что хотя победители часто оставались стабильными в рамках допущенных и оспоренных спецификаций, полный рейтинг не всегда определялся в пределах чувствительности. Инструмент требует от пользователей указания семантических целей, варьируемых параметров и доказательств для каждой кандидатуры спецификации.

EvalAudit обеспечивает воспроизведение детерминированных аудитов с малыми затратами на основе замороженных объявлений оценок без повторной генерации исходных баллов. Он разделяет семантическую неопределённость от выборочной и стохастической неопределённости, предоставляя нормализованные JSON-отчёты и манифесты с контрольными суммами для проверки.