Pesquisadores introduzem o BenchMIRT, um método para auditar benchmarks de grandes modelos de linguagem no nível de prompt individual usando Teoria de Resposta ao Item multidimensional. Ao analisar o desempenho em 100 modelos e 34.000 perguntas, a ferramenta desassocia capacidades mistas como segurança e raciocínio geral que frequentemente obscurecem as pontuações do benchmark.

  • BenchMIRT recuperou independentemente segurança e raciocínio geral como dimensões dominantes sem rotulagem prévia.
  • Revelou que benchmarks como BBQ e WMDP se correlacionam mais fortemente com o raciocínio geral do que seu foco de segurança pretendido sugere.
  • O método identifica as perguntas mais informativas, mostrando que reter apenas 10% dos itens pode preservar quase a mesma avaliação de capacidades.
  • BenchMIRT prevê a correção de perguntas não vistas com precisão de 79%, superando abordagens de linha de base mais simples.

Esta abordagem ajuda pesquisadores a entender o que os benchmarks realmente medem e a projetar avaliações mais eficientes e focadas, removendo perguntas menos informativas.