Benchmark · general
MMLU
يختبر MMLU (Massive Multitask Language Understanding) اتساع معرفة النموذج عبر 57 مادة — من التاريخ والقانون إلى الرياضيات والطب — باستخدام أسئلة الاختيار من متعدد. وتُعرض النتيجة كنسبة دقة مئوية (% accuracy)، أي نسبة الأسئلة المُجاب عنها بشكل صحيح.
اقرأ المزيد
- مثال
- يتضمن السؤال النموذجي سؤالًا وأربعة خيارات موسومة (A–D)، وعلى النموذج اختيار الإجابة الصحيحة — مثل سؤال في الطب بمستوى جامعي أو مسألة رياضيات بسيطة.
- طريقة التقييم
- المقياس هو الدقة (accuracy): النسبة المئوية لأسئلة الاختيار من متعدد التي يختار فيها النموذج الخيار الصحيح، محسوبةً كمتوسط عبر المواد الـ57 كلها.
- التحقق
- التصحيح آلي وموضوعي — إذ يُطابَق الحرف الذي اختاره النموذج مطابقةً تامة (exact-match) مع الإجابة الصحيحة المعروفة، دون حاجة إلى حكم بشري.
- لماذا يهم
- أصبح MMLU مقياسًا معياريًا لاتساع المعرفة والاستدلال، لكن أفضل النماذج تحقق فيه درجات عالية جدًا حتى بات مُشبَعًا إلى حد كبير وأقل قدرة على التمييز بين أقوى الأنظمة.
مثال محلول
المهمة
فيما يلي سؤال اختيار من متعدد حول كيمياء المرحلة الثانوية. أيٌّ مما يلي حمض قوي؟ A) HF B) HCl C) CH3COOH D) H2CO3
الحل
يتأيّن HCl تأيّناً كاملاً في الماء، لذا فهو حمض قوي؛ أما HF وCH3COOH وH2CO3 فتتأيّن جزئياً فقط (أحماض ضعيفة). الإجابة النهائية: B) HCl.
الشرح
الحمض القوي ينفصل تماماً إلى H+ وقاعدته المرافقة في المحلول المائي، وهو ما يفعله HCl دون البقية. يُقيّم MMLU الإجابة بدقة التطابق التام: يجب أن يساوي حرف الخيار المختار مفتاح الإجابة الصحيح (B).