Les chercheurs présentent BenchMIRT, une méthode pour auditer les benchmarks de grands modèles de langage au niveau du prompt individuel en utilisant la théorie multidimensionnelle de la réponse à l'item. En analysant les performances sur 100 modèles et 34 000 questions, l'outil démêle les capacités mélangées comme la sécurité et le raisonnement général qui obscurcissent souvent les scores du benchmark.

  • BenchMIRT a récupéré indépendamment la sécurité et le raisonnement général comme dimensions dominantes sans étiquetage préalable.
  • Il a révélé que des benchmarks comme BBQ et WMDP sont plus fortement corrélés au raisonnement général que ne le suggère leur focus de sécurité prévu.
  • La méthode identifie les questions les plus informatives, montrant que conserver seulement 10% des éléments peut préserver presque la même évaluation des capacités.
  • BenchMIRT prédit la correction des questions hors échantillon avec une précision de 79 %, surpassant les approches de base plus simples.

Cette approche aide les chercheurs à comprendre ce que mesurent réellement les benchmarks et à concevoir des évaluations plus efficaces et ciblées en supprimant les questions moins informatives.