Les chercheurs présentent BenchMIRT, une méthode pour auditer les benchmarks de grands modèles de langage au niveau du prompt individuel en utilisant la théorie multidimensionnelle de la réponse à l'item. En analysant les performances sur 100 modèles et 34 000 questions, l'outil démêle les capacités mélangées comme la sécurité et le raisonnement général qui obscurcissent souvent les scores du benchmark.
- BenchMIRT a récupéré indépendamment la sécurité et le raisonnement général comme dimensions dominantes sans étiquetage préalable.
- Il a révélé que des benchmarks comme BBQ et WMDP sont plus fortement corrélés au raisonnement général que ne le suggère leur focus de sécurité prévu.
- La méthode identifie les questions les plus informatives, montrant que conserver seulement 10% des éléments peut préserver presque la même évaluation des capacités.
- BenchMIRT prédit la correction des questions hors échantillon avec une précision de 79 %, surpassant les approches de base plus simples.
Cette approche aide les chercheurs à comprendre ce que mesurent réellement les benchmarks et à concevoir des évaluations plus efficaces et ciblées en supprimant les questions moins informatives.