연구자들은 다차원 항목 반응 이론(Item Response Theory)을 사용하여 개별 프롬프트 수준에서 대규모 언어 모델 벤치마크를 감사하는 방법인 BenchMIRT를 소개했습니다. 100개 모델과 34,000개의 질문에 대한 성능을 분석함으로써 이 도구는 벤치마크 점수를 흐리게 하는 안전과 일반 추론과 같은 혼합 능력을 분리합니다.

  • BenchMIRT는 사전 레이블링 없이 안전과 일반 추론을 지배적인 차원으로 독립적으로 복원했습니다.
  • BBQ와 WMDP와 같은 벤치마크가 의도된 안전 초점보다 일반 추론과 더 강하게 상관관계가 있음을 밝혔습니다.
  • 이 방법은 가장 정보량이 많은 질문을 식별하며, 항목의 10%만 유지해도 거의 동일한 능력 평가가 가능함을 보여줍니다.
  • BenchMIRT는 홀드아웃 질문의 정확도를 79%로 예측하여 더 간단한 베이스라인 접근법보다 우수합니다.

이 접근법은 연구자들이 벤치마크가 실제로 무엇을 측정하는지 이해하고 덜 정보량이 많은 질문을 제거하여 더 효율적이고 초점을 맞춘 평가를 설계하는 데 도움이 됩니다.