حقق النموذج اللغوي الجديد من OpenAI، وهو o3، نتيجة بنسبة 25% على معيار FrontierMath، وهو مجموعة بيانات سرية تحتوي على مئات من الأسئلة الرياضية الصعبة التي جمعها Epoch AI. تتكون المجموعة من مسائل ذات إجابات محددة وقابلة للحساب، ويمكن التحقق منها آلياً، وهي مصممة لمنع النماذج من مجرد حفظ الحلول المتاحة للعامة.
- يحتوي FrontierMath على "مئات" من الأسئلة الرياضية الصعبة، حيث تم إصدار أقل من 200 سؤال في البداية وأضيف المزيد لاحقاً.
- تتطلب المسائل الخمس المتاحة للعامة إجابات بأعداد صحيحة موجبة، مثل 9811 و367707، وتتضمن مفاهيم معقدة مثل الاستمرارية p-adic ومخططات Weil.
- بينما تمكن المؤلف من حل سؤالين من الأسئلة العامة الخمسة باستخدام خبرته في الحساب، أشار إلى أن طالب جامعي ذكي في الرياضيات على الأرجح سيواجه صعوبة حتى في حل سؤال واحد.
- اقترح إليوت غلازر من Epoch AI أن 25% من المجموعة تتكون من "مسائل على نمط أولمبياد الرياضيات الدولية (IMO) ومستوى البكالوريوس"، مما يثير تساؤلات حول مستوى الصعوبة العام وتمثيلية العينات المتاحة للعامة.
تعتبر هذه النتيجة مهمة لأن مجال الذكاء الاصطناعي للرياضيات يفتقر إلى مجموعات بيانات صعبة، وإنشاء مثل هذه المعايير أمر صعب ومكلف. أعرب المؤلف عن صدمته من النتيجة، مشيراً إلى أن الذكاء الاصطناعي يتحسن بسرعة في مسائل على نمط الأولمبياد، لكن الوصول إلى مستوى الابتكار المتعلق بمستوى البكالوريوس المتقدم أو الدكتوراه كان يُعتبر سابقاً هدفاً بعيد المنال.