يطرح الباحثون MMLU-Pro، نسخة محسّنة من معيار Massive Multitask Language Understanding مصممة لمعالجة تشبع الأداء وعدم الاستقرار في نماذج اللغة الكبيرة الحالية. يوسّع المجموعة الجديدة خيارات الإجابة من أربعة إلى عشرة، وتدمج أسئلة استدلال صعبة على مستوى الكلية، وتزيل العناصر المشوشة عبر مراجعة الخبراء.

  • ينخفض الدقة بنسبة 16% إلى 33% مقارنة بـ MMLU، حيث حصل النموذج الأعلى GPT-4o على 72.6% فقط.
  • تنخفض حساسية نتائج النماذج للتغيرات في الصياغة من 4-5% في MMLU إلى 2% فقط في MMLU-Pro عبر 24 نمطاً مختلفاً.
  • يعزز الاستدلال المتسلسل (Chain of Thought) الأداء بشكل كبير على MMLU-Pro، محسّناً نتائج GPT-4o بنسبة 19%، بينما يضر بالنتائج في المعيار الأصلي.
  • يمتد المعيار عبر 14 مجالاً مع أكثر من 12,000 سؤال، مما يوفر قدرة تمييزية أكبر بين نماذج مثل GPT-4o وGPT-4-Turbo.

يُعد MMLU-Pro مقياساً أكثر موثوقية وصعوبة لتتبع التقدم في قدرات الفهم والاستدلال على مستوى الخبراء.