Para peneliti memperkenalkan BenchMIRT, sebuah metode untuk mengaudit benchmark model bahasa besar pada tingkat prompt individu menggunakan Teori Respons Item multidimensional. Dengan menganalisis kinerja di 100 model dan 34.000 pertanyaan, alat ini memisahkan kemampuan campuran seperti keamanan dan penalaran umum yang sering mengaburkan skor benchmark.

  • BenchMIRT secara independen memulihkan keamanan dan penalaran umum sebagai dimensi dominan tanpa pelabelan sebelumnya.
  • Ini mengungkapkan bahwa benchmark seperti BBQ dan WMDP berkorelasi lebih kuat dengan penalaran umum daripada fokus keamanan yang dimaksudkan.
  • Metode ini mengidentifikasi pertanyaan paling informatif, menunjukkan bahwa menyimpan hanya 10% item dapat mempertahankan hampir penilaian kemampuan yang sama.
  • BenchMIRT memprediksi kebenaran pertanyaan yang dihold-out dengan akurasi 79%, melampaui pendekatan baseline yang lebih sederhana.

Pendekatan ini membantu peneliti memahami apa yang sebenarnya diukur oleh benchmark dan merancang evaluasi yang lebih efisien dan terfokus dengan menghapus pertanyaan yang kurang informatif.