أطلقت إيبوك آي (Epoch AI) معيار FrontierMath، وهو مجموعة تقييم تتكون من مئات من مسائل الرياضيات الأصلية التي أعدها خبراء متخصصون بهدف تقييم قدرات الاستدلال المتقدمة في أنظمة الذكاء الاصطناعي. وقد تم تطوير هذه المسائل بالتعاون مع أكثر من 60 رياضياً، بمن فيهم حاصلو ميدالية فيلدز (Fields medalists)، وتغطي مجالات بحثية حديثة مثل نظرية الأعداد والهندسة الجبرية، وتتطلب عادةً ساعات أو أياماً من الخبراء لحلها.
- تتميز مجموعة التقييم بمسائل "مقاومة للتخمين" وقابلة للتحقق آلياً عبر الحساب.
- أظهر تقييم ستة نماذج رائدة، بما في ذلك Claude 3.5 Sonnet و GPT-4o، عدم قدرة أي منها على حل أكثر من 2% من المسائل رغم الدعم الواسع للإطارات المرجعية.
- يتناقض هذا الأداء بشكل حاد مع معايير مثل GSM-8K، حيث تحقق النماذج العليا دقة تتجاوز 90%.
- تخطط إيبوك آي لإجراء تقييمات منتظمة، وتوسيع نطاق المعيار، وإطلاق مسائل إضافية في الأشهر القادمة.
يهدف FrontierMath إلى توفير مقياس موحد للتقدم في الاستدلال الرياضي على مستوى البحث مع تقدم أنظمة الذكاء الاصطناعي، مما يسلط الضوء على فجوة كبيرة بين قدرات الذكاء الاصطناعي الحالية ورياضيي الخبراء.