يقدم الباحثون BenchMIRT، وهي طريقة لمراجعة معايير نماذج اللغة الكبيرة على مستوى الموجه الفردي باستخدام نظرية الاستجابة للعنصر متعددة الأبعاد. من خلال تحليل الأداء عبر 100 نموذج و34,000 سؤال، يفكك الأداة القدرات المختلطة مثل الأمان والاستدلال العام التي غالبًا ما تحجب درجات المعيار.

  • استعاد BenchMIRT بشكل مستقل الأمان والاستدلال العام كأبعاد مهيمنة دون تسمية مسبقة.
  • كشف أن معايير مثل BBQ وWMDP ترتبط بقوة أكبر بالاستدلال العام مما تشير إليه تركيزها المقصود على الأمان.
  • تحدد الطريقة الأسئلة الأكثر إفادة، وتظهر أن الاحتفاظ بـ 10% فقط من العناصر يمكن أن يحافظ على تقييم القدرات نفسه تقريبًا.
  • يتنبأ BenchMIRT بصحة الأسئلة المحجوزة بدقة 79٪، متفوقًا على أساليب الأساس الأبسط.

يساعد هذا النهج الباحثين على فهم ما تقيسه المعايير فعليًا وتصميم تقييمات أكثر كفاءة وتركيزًا من خلال إزالة الأسئلة الأقل إفادة.