أظهرت نتائج المعايير المستقلة التي نشرتها Epoch AI أن نموذج o3 الذي أطلقته OpenAI للعامة حصل على حوالي 10% على مجموعة بيانات FrontierMath، وهو ما يقل بشكل كبير عن النتيجة التي تجاوزت 25% والتي سلطت الشركة الضوء عليها في البداية خلال كشفها عنه في ديسمبر.
- قامت Epoch AI بتقييم نموذج o3 المُطلق باستخدام نسخة محدثة من معيار FrontierMath ووجدت نتيجة حوالي 10%.
- تم تحقيق الادعاء الأولي لـ OpenAI الذي تجاوز 25% باستخدام إعدادات حساب مكثفة عند وقت الاختبار على هيكل داخلي أقوى من الإصدار العام.
- أكدت مؤسسة ARC Prize أن o3 العام مُضبط للاستخدام في الدردشة والمنتجات، مع مستويات حساب أصغر من النسخة التجريبية التي اختبروها.
- صرح موظفو OpenAI الفنيون أن نموذج الإنتاج مُحسّن للكفاءة من حيث التكلفة والسرعة بدلاً من الأداء الأقصى على المعايير.
تسلط هذه الفجوة الضوء على أهمية التحقق من معايير الجهات الخارجية وتوضح أن النموذج المُطلق يعطي الأولوية للفائدة الواقعية على النتائج الأكاديمية القصوى.