Benchmark · math

FrontierMath

20 نتائج 15 نماذج

FrontierMath هو معيار (benchmark) من Epoch AI يقيس مدى قدرة نموذج الذكاء الاصطناعي على حل مسائل رياضية بالغة الصعوبة وأصلية على مستوى البحث العلمي. الدرجة هي النسبة المئوية للمسائل التي يجيب عنها النموذج إجابة صحيحة، والنماذج الحالية لا تحل سوى جزء صغير منها، أي أنها بعيدة جدًا عن التشبّع.

اقرأ المزيد
مثال
مسألة واحدة لم تُنشر من قبل، مأخوذة من مجال متقدم مثل نظرية الأعداد أو الهندسة الجبرية أو التوافقيات، ويتطلب حلها خبرة عميقة وينتهي إلى إجابة نهائية محددة واحدة (مثل عدد صحيح بعينه أو كائن رياضي دقيق).
طريقة التقييم
المقياس هو الدقة (accuracy): نسبة المسائل التي تتطابق إجابتها النهائية تمامًا مع الإجابة المرجعية، وتُعرض كنسبة مئوية.
التحقق
لكل مسألة إجابة واحدة محددة يمكن التحقق منها آليًا، فلا يُقبل الحل إلا إذا طابق الإجابة المرجعية تمامًا؛ وقد صمّم المسائلَ رياضيون خبراء بحيث يكاد يستحيل الوصول إلى الإجابة الصحيحة بالتخمين.
لماذا يهم
لأن المسائل جديدة فهو يقاوم الحفظ، ولا يزال بعيدًا عن أن يُحَل بالكامل، ما يجعله واحدًا من المعايير الرياضية القليلة التي لا تزال تفصل بوضوح بين التفكير الرياضي المتقدم الحقيقي وبين مجرد مطابقة الأنماط.
مثال محلول
المهمة
أوجد عدد الأعداد الصحيحة $n$ التي تحقق $0 \le n < 3^{13}$ بحيث لا يقبل المعامل الثنائي المركزي $\binom{2n}{n}$ القسمة على $3$.
الحل
حسب مبرهنة Kummer، يكون $3 \nmid \binom{2n}{n}$ بالضبط عندما لا ينتج عن جمع $n+n$ في الأساس 3 أي حمل (carry)، أي أن كل رقم من أرقام $n$ في الأساس 3 يساوي 0 أو 1. على المجال $0 \le n < 3^{13}$ يعطي هذا خيارين لكل رقم من الأرقام الـ 13، فيكون العدد $2^{13} = 8192$.
الشرح
تعطي مبرهنة Kummer القيمة $v_3\binom{2n}{n}$ بوصفها عدد مرات الحمل عند جمع $n$ مع نفسه في الأساس 3؛ وانعدام الحمل يفرض أن يكون كل رقم في الأساس 3 مساوياً 0 أو 1، أي خياران لكل رقم على مدى 13 رقماً. التقييم: يطابق مدقّق آلي القيمة الصحيحة النهائية الوحيدة (8192) مطابقة تامة.
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-04-25 GPT-5.5 51.7% OpenAI تطلق GPT-5.5، نموذج مُعاد تدريبه من الصفر مع معالجة أومني مودال أصلية
2026-04-23 GPT-5.5 Pro 39.6% OpenAI تطلق GPT-5.5 بقدرات وكيلية ومضاعفة أسعار واجهة برمجة التطبيقات
2026-04-23 GPT-5.5 35.4% OpenAI تطلق GPT-5.5 بقدرات وكيلية ومضاعفة أسعار واجهة برمجة التطبيقات
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro يحقق 31% في FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% أوبن إيه آي تطلق نماذج GPT-5.2 Pro وThinking للعلوم والرياضيات
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI تطلق مركز بيانات الحدود وتحلل معيار OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI تطلق مركز بيانات الحدود وتحلل معيار OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro يحل مشكلة جديدة من المستوى الرابع في FrontierMath، متقدماً على Gemini 2.5 Deep Think بفارق ضئيل
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI تقيم قدرات Gemini 2.5 Deep Think الرياضية
2025-04-20 o3 10.0% تحقق o3 من OpenAI نتائج أقل على FrontierMath مما أُعلن في البداية
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% تقييم Epoch لـ o3-mini على FrontierMath يعطي 11% مقابل 32% من OpenAI
2025-01-29 o3 25.0% نموذج o3 من OpenAI يحقق 25% في معيار Frontier Math
2025-01-19 o3 25.2% OpenAI مولت معيار FrontierMath قبل أن يحقق o3 رقماً قياسياً
2024-12-22 o3 25.0% حقق نموذج o3 من OpenAI نسبة 25% في معيار FrontierMath الرياضي الصعب
2024-12-20 o3 25.0% OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% إيبوك آي تطلق معيار FrontierMath لتقييم الاستدلال الرياضي المتقدم
2024-11-08 Gemini 1.5 Pro 2.0% إيبوك آي تطلق معيار FrontierMath لتقييم الاستدلال الرياضي المتقدم
2024-11-08 GPT-4o 2.0% إيبوك آي تطلق معيار FrontierMath لتقييم الاستدلال الرياضي المتقدم
2024-11-08 o1-preview 2.0% إيبوك آي تطلق معيار FrontierMath لتقييم الاستدلال الرياضي المتقدم