O artigo apresenta o EvalAudit, um artefato executável projetado para determinar se uma conclusão de benchmark — como um vencedor ou classificação completa — é identificada em uma família declarada de especificações de avaliador. Ao fixar os sistemas avaliados e os dados, enquanto variam as métricas e as regras de agregação, a ferramenta calcula se o conjunto de possíveis afirmações permanece como um único elemento.
Os autores aplicaram o EvalAudit a três benchmarks heterogêneos: AgentDojo v0.1.35, AutoML Benchmark e BEIR SciFact. Os resultados mostraram que, embora os vencedores fossem frequentemente estáveis entre especificações admitidas e contestadas, as classificações completas nem sempre eram identificadas dentro do envelope de sensibilidade. A ferramenta exige que os usuários declarem alvos semânticos, escolhas variáveis e evidências para cada especificação candidata.
O EvalAudit permite a reprodução de baixo custo de auditorias determinísticas a partir de declarações de pontuação congeladas, sem a necessidade de regenerar as pontuações originais. Ele separa a incerteza semântica da incerteza de amostragem e estocástica, fornecendo relatórios JSON normalizados e manifestos com checksum fechado para verificação.