تدعي OpenAI أن نموذجها o3-mini، الذي يتمتع بقدرة عالية على الاستنتاج والوصول إلى أدوات Python، يحقق نتيجة بنسبة 32% في معيار FrontierMath. ومع ذلك، فإن التقييم الرسمي المستقل من Epoch يبلغ عن نتيجة أقل بكثير تبلغ 11% فقط.

  • قام Epoch ببناء المعيار ولديه حوافز أفضل للتدقيق في النتائج.
  • أفادت OpenAI بنتيجة بنسبة 28% في أصعب طبقة من المشكلات، وهو ما يقترب بشكل مشبوه من نتيجتها الإجمالية.
  • نشرت Epoch معلومات واسعة حول بنية الاختبار والبيانات الخاصة بها، بينما نشرت OpenAI القليل.
  • قد يعود التباين إلى استخدام OpenAI لسقالة داخلية أكثر قوة، أو المزيد من الحوسبة أثناء الاختبار، أو مجموعة فرعية مختلفة من المشكلات (180 مقابل 290).

تسلط الفروق في النتائج الضوء على أهمية منهجيات التقييم الشفافة والتحقق المستقل في تقييم نماذج اللغة الكبيرة.