Исследователи представляют BenchMIRT, метод аудита бенчмарков больших языковых моделей на уровне отдельных промптов с использованием многомерной теории ответа на вопрос (Item Response Theory). Анализируя результаты работы 100 моделей и 34 000 вопросов, инструмент разделяет смешанные способности, такие как безопасность и общее рассуждение, которые часто искажают оценки в бенчмарках.
- BenchMIRT независимо выделил безопасность и общее рассуждение как доминирующие измерения без предварительной маркировки.
- Выявлено, что бенчмарки BBQ и WMDP сильнее коррелируют с общим рассуждением, чем предполагает их заявленная ориентация на безопасность.
- Метод определяет наиболее информативные вопросы, показывая, что сохранение всего 10% элементов может сохранить почти ту же оценку способностей.
- BenchMIRT предсказывает правильность ответов на отложенных вопросах с точностью 79%, превосходя более простые базовые подходы.
Этот подход помогает исследователям понять, что именно измеряют бенчмарки, и разрабатывать более эффективные и сфокусированные оценки за счет удаления менее информативных вопросов.