Los investigadores presentan BenchMIRT, un método para auditar benchmarks de modelos de lenguaje grandes a nivel de prompt individual utilizando Teoría de Respuesta al Ítem multidimensional. Al analizar el rendimiento en 100 modelos y 34.000 preguntas, la herramienta desentraña capacidades mezcladas como seguridad y razonamiento general que a menudo oscurecen las puntuaciones del benchmark.

  • BenchMIRT recuperó independientemente la seguridad y el razonamiento general como dimensiones dominantes sin etiquetado previo.
  • Reveló que benchmarks como BBQ y WMDP se correlacionan más fuertemente con el razonamiento general de lo que sugiere su enfoque de seguridad pretendido.
  • El método identifica las preguntas más informativas, mostrando que retener solo el 10% de los elementos puede preservar casi la misma evaluación de capacidades.
  • BenchMIRT predice la corrección de preguntas no vistas con un 79% de precisión, superando a enfoques base más simples.

Este enfoque ayuda a los investigadores a entender qué miden realmente los benchmarks y diseñar evaluaciones más eficientes y enfocadas eliminando preguntas menos informativas.