Benchmark · general

MMLU

saturated 15 نتائج 12 نماذج

يختبر MMLU (Massive Multitask Language Understanding) اتساع معرفة النموذج عبر 57 مادة — من التاريخ والقانون إلى الرياضيات والطب — باستخدام أسئلة الاختيار من متعدد. وتُعرض النتيجة كنسبة دقة مئوية (% accuracy)، أي نسبة الأسئلة المُجاب عنها بشكل صحيح.

اقرأ المزيد
مثال
يتضمن السؤال النموذجي سؤالًا وأربعة خيارات موسومة (A–D)، وعلى النموذج اختيار الإجابة الصحيحة — مثل سؤال في الطب بمستوى جامعي أو مسألة رياضيات بسيطة.
طريقة التقييم
المقياس هو الدقة (accuracy): النسبة المئوية لأسئلة الاختيار من متعدد التي يختار فيها النموذج الخيار الصحيح، محسوبةً كمتوسط عبر المواد الـ57 كلها.
التحقق
التصحيح آلي وموضوعي — إذ يُطابَق الحرف الذي اختاره النموذج مطابقةً تامة (exact-match) مع الإجابة الصحيحة المعروفة، دون حاجة إلى حكم بشري.
لماذا يهم
أصبح MMLU مقياسًا معياريًا لاتساع المعرفة والاستدلال، لكن أفضل النماذج تحقق فيه درجات عالية جدًا حتى بات مُشبَعًا إلى حد كبير وأقل قدرة على التمييز بين أقوى الأنظمة.
مثال محلول
المهمة
فيما يلي سؤال اختيار من متعدد حول كيمياء المرحلة الثانوية. أيٌّ مما يلي حمض قوي؟ A) HF B) HCl C) CH3COOH D) H2CO3
الحل
يتأيّن HCl تأيّناً كاملاً في الماء، لذا فهو حمض قوي؛ أما HF وCH3COOH وH2CO3 فتتأيّن جزئياً فقط (أحماض ضعيفة). الإجابة النهائية: B) HCl.
الشرح
الحمض القوي ينفصل تماماً إلى H+ وقاعدته المرافقة في المحلول المائي، وهو ما يفعله HCl دون البقية. يُقيّم MMLU الإجابة بدقة التطابق التام: يجب أن يساوي حرف الخيار المختار مفتاح الإجابة الصحيح (B).
0 24 48 72 96 2023-03-14 2024-03-29 2025-04-15 Gemini Ultra · 90 · 2023-12-06 Gemini Ultra · 90 · 2023-12-06 Qwen2-72B · 84.2 · 2024-07-15 Qwen2-72B · 84.2 · 2024-07-15 Mistral Large 2 · 84 · 2024-07-24 Mistral Large 2 · 84 · 2024-07-25 Falcon3-10B-Base · 73.1 · 2024-12-17 Falcon3-7B-Base · 67.4 · 2024-12-17 Claude 3.7 Sonnet · 86.1 · 2025-02-24 GPT‑4.1 nano · 80.1 · 2025-04-14 Gemini 2.0 Flash · 83.4 · 2025-04-15 GPT-3.5 · 70 · 2023-03-14 GPT-4 · 86.4 · 2023-03-14 Claude 2 · 78.5 · 2023-07-11 Claude 3 Opus · 86.8 · 2024-03-04
Gemini Ultra Qwen2-72B Mistral Large 2 Falcon3-10B-Base Falcon3-7B-Base Claude 3.7 Sonnet GPT‑4.1 nano Gemini 2.0 Flash GPT-3.5 GPT-4 Claude 2 Claude 3 Opus
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2025-04-15 Gemini 2.0 Flash 83.4% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-04-14 GPT‑4.1 nano 80.1% OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
2025-02-24 Claude 3.7 Sonnet 86.1% أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
2024-12-17 Falcon3-10B-Base 73.1% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-7B-Base 67.4% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-07-25 Mistral Large 2 84.0% مسترال تطلق نموذج مسترال لايرج 2 بدعم سياق 128K ودعم متعدد اللغات محسّن
2024-07-24 Mistral Large 2 84.0% مسترال تطلق نموذج Large 2 بـ 123 مليار معلمة للاستدلال بكفاءة على عقدة واحدة
2024-07-15 Qwen2-72B 84.2% فريق Qwen يُصدر سلسلة Qwen2 بنماذج كثيفة و MoE بحجم 72 مليار
2024-07-15 Qwen2-72B 84.2% تقرير Qwen2 التقني يقدم نماذج كثيفة ونماذج MoE تصل إلى 72 مليار معلمة
2024-03-04 Claude 3 Opus 86.8% Anthropic
2023-12-06 Gemini Ultra 90.0% جوجل تقدم Gemini 1.0، أكبر نموذج ذكاء اصطناعي متعدد الوسائط لديها
2023-12-06 Gemini Ultra 90.0% Google
2023-07-11 Claude 2 78.5% Anthropic
2023-03-14 GPT-3.5 70.0% OpenAI
2023-03-14 GPT-4 86.4% OpenAI