L'article présente EvalAudit, un exécutable conçu pour déterminer si une conclusion de benchmark — comme un gagnant ou un classement complet — est identifiée au sein d'une famille déclarée de spécifications d'évaluateur. En fixant les systèmes évalués et les données tout en faisant varier les métriques et les règles d'agrégation, l'outil calcule si l'ensemble des affirmations possibles reste un singleton.
Les auteurs ont appliqué EvalAudit à trois benchmarks hétérogènes : AgentDojo v0.1.35, AutoML Benchmark et BEIR SciFact. Les résultats ont montré que si les gagnants étaient souvent stables entre les spécifications admises et contestées, les classements complets n'étaient pas toujours identifiés dans l'enveloppe de sensibilité. L'outil nécessite que les utilisateurs déclarent des cibles sémantiques, des choix variables et des preuves pour chaque spécification candidate.
EvalAudit permet la reproduction à faible coût d'audits déterministes à partir de déclarations de scores figées sans régénérer les scores en amont. Il sépare l'incertitude sémantique de l'incertitude d'échantillonnage et stochastique, fournissant des rapports JSON normalisés et des manifestes fermés par somme de contrôle pour la vérification.