Benchmark · general

MMLU-Pro

11 نتائج 10 نماذج

MMLU-Pro هو خلَف أصعب وأكثر تركيزًا على الاستدلال لاختبار MMLU، ويقيس معرفة النموذج وقدرته على حل المسائل عبر العديد من التخصصات الأكاديمية من خلال أسئلة اختيار من متعدد تضم 10 خيارات للإجابة في كل سؤال. تُعرض النتيجة كنسبة مئوية من الدقة — أي نسبة الأسئلة المُجاب عنها بشكل صحيح.

اقرأ المزيد
مثال
المهمة النموذجية هي سؤال اختيار من متعدد من مجال مثل الرياضيات أو الفيزياء أو القانون أو الهندسة يتطلب عدة خطوات استدلال، حيث يجب على النموذج اختيار الإجابة الصحيحة الوحيدة من بين 10 خيارات (مقابل 4 في MMLU الأصلي).
طريقة التقييم
المقياس هو الدقة (accuracy): النسبة المئوية للأسئلة التي يختار فيها النموذج الخيار الصحيح، وتُحسب بقسمة عدد الإجابات الصحيحة على إجمالي عدد الأسئلة.
التحقق
تُصحَّح كل إجابة تلقائيًا عبر المطابقة التامة (exact match) بين الخيار الذي اختاره النموذج والتسمية الصحيحة المعروفة، دون الحاجة إلى تقييم بشري.
لماذا يهم
لأن النماذج الرائدة كانت قد أشبعت اختبار MMLU الأصلي تقريبًا، فإن الأسئلة الأصعب و10 خيارات في MMLU-Pro تجعله أكثر تمييزًا وأكثر حساسية للاستدلال الحقيقي، مما يوفّر مؤشرًا أوضح على التقدّم.
مثال محلول
المهمة
MMLU-Pro (فيزياء، 10 خيارات). يُطلَق مقذوف من مستوى الأرض بسرعة 20 m/s وبزاوية 30° فوق الأفق (g = 10 m/s²، بدون مقاومة هواء). ما أقصى ارتفاع يبلغه؟ A) 2.5 m B) 5.0 m C) 7.5 m D) 10.0 m E) 12.5 m F) 15.0 m G) 17.3 m H) 20.0 m I) 3.5 m J) 8.7 m
الحل
v_y = v·sin30° = 20 × 0.5 = 10 m/s; h_max = v_y² / (2g) = 10² / (2 × 10) = 5.0 m → B
الشرح
عند أعلى نقطة تكون السرعة الرأسية صفرًا، لذا h_max = v_y²/(2g) حيث v_y = v·sin30°؛ المركبة الرأسية وحدها تحدد الارتفاع. يقيّم MMLU-Pro بالمطابقة التامة للحرف المختار مع مفتاح الإجابة الصحيح (accuracy على خياراته العشرة).
0 24 48 72 96 2024-06-03 2024-12-30 2025-07-28 GPT-4o · 72.6 · 2024-06-03 GPT-4o · 72.6 · 2024-06-03 GPT-4-Turbo · 63.7 · 2024-06-03 Claude 3.5 Sonnet · 90.4 · 2024-06-20 Falcon3-3B-Instruct · 29.7 · 2024-12-17 Falcon3-7B-Base · 39.2 · 2024-12-17 Falcon3-10B-Base · 42.5 · 2024-12-17 DeepSeek-V3-0324 · 81.2 · 2025-03-24 Gemini 2.0 Flash · 77.6 · 2025-04-15 Deepseek-R1-0528 · 85 · 2025-05-30 GLM-4.5 · 84.6 · 2025-07-28
GPT-4o GPT-4-Turbo Claude 3.5 Sonnet Falcon3-3B-Instruct Falcon3-7B-Base Falcon3-10B-Base DeepSeek-V3-0324 Gemini 2.0 Flash Deepseek-R1-0528 GLM-4.5
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2025-07-28 GLM-4.5 84.6% تشيبو آي تطلق نماذج GLM-4.5 وGLM-4.5-Air الأساسية للوكلاء الأذكياء
2025-05-30 Deepseek-R1-0528 85.0% ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
2025-04-15 Gemini 2.0 Flash 77.6% جوجل تطلق Gemini 2.0 Flash بجودة محسّنة وسرعة ضعف سرعة Gemini 1.5 Pro
2025-03-24 DeepSeek-V3-0324 81.2% DeepSeek-V3-0324 يحسّن الاستدلال والبرمجة والكتابة الصينية مقارنة بـ DeepSeek-V3
2024-12-17 Falcon3-3B-Instruct 29.7% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-7B-Base 39.2% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-10B-Base 42.5% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-06-20 Claude 3.5 Sonnet 90.4% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية
2024-06-03 GPT-4o 72.6% يقدم MMLU-Pro معيار تقييم أكثر متانة بأسئلة تركز على الاستدلال وخيارات متعددة
2024-06-03 GPT-4-Turbo 63.7% يقدم MMLU-Pro معيار تقييم أكثر متانة بأسئلة تركز على الاستدلال وخيارات متعددة
2024-06-03 GPT-4o 72.6% MMLU-Pro paper