El artículo presenta EvalAudit, un artefacto ejecutable diseñado para determinar si una conclusión de un benchmark —como un ganador o una clasificación completa— se identifica a través de una familia declarada de especificaciones de evaluador. Al fijar los sistemas evaluados y los datos mientras se varían las métricas y las reglas de agregación, la herramienta calcula si el conjunto de afirmaciones posibles sigue siendo un único elemento.
Los autores aplicaron EvalAudit a tres benchmarks heterogéneos: AgentDojo v0.1.35, AutoML Benchmark y BEIR SciFact. Los resultados mostraron que, aunque los ganadores eran a menudo estables entre las especificaciones admitidas y disputadas, las clasificaciones completas no siempre se identificaban dentro del envolvente de sensibilidad. La herramienta requiere que los usuarios declaren objetivos semánticos, opciones variables y evidencia para cada especificación candidata.
EvalAudit permite la reproducción de bajo costo de auditorías deterministas a partir de declaraciones de puntuación congeladas sin regenerar las puntuaciones originales. Separa la incertidumbre semántica de la incertidumbre por muestreo y estocástica, proporcionando informes JSON normalizados y manifiestos con checksum cerrado para verificación.