قدمت OpenAI تمويلاً لمعيار الرياضيات المستقل FrontierMath بينما كانت ملتزمة باتفاقية عدم إفشاء تمنعت Epoch AI من الكشف عن هذه العلاقة حتى بعد إعلان OpenAI عن الأداء القياسي لنموذجها o3. يختبر المعيار، الذي طوره أكثر من 60 رياضياً، مهارات الاستدلال المعقدة، وحقق نموذج o3 التابع لـ OpenAI معدل نجاح بنسبة 25.2 في المئة عليه.
- أُطلق FrontierMath في نوفمبر 2024 لتقييم قدرات حل المشكلات الرياضية المتقدمة.
- وقعت Epoch AI اتفاقاً يمنع الإفشاء عن الدعم المالي من OpenAI حتى إعلان o3 في 20 ديسمبر.
- وُضعت مسائل المعيار بواسطة فريق يضم أكثر من 60 رياضياً رائداً لم يكونوا على علم بمصدر التمويل.
- حصلت OpenAI على وصول إلى "جزء كبير لكن ليس كل" بيانات FrontierMath، رغم أن اتفاقاً شفوياً منع استخدام المواد لتدريب النماذج.
- تعترف Epoch AI بعدم الشفافية كخطأ وتعد بمعلومات أكثر وضوحاً حول مصادر التمويل في التعاونات المستقبلية.
تسلط هذه الحالة الضوء على تعقيد تقييم نماذج الذكاء الاصطناعي وأهمية الشفافة، خاصةً أن الاستدلال الرياضي يمثل نقطة ضعف كبيرة للنماذج اللغوية.