OpenAI दावा करता है कि इसका o3-mini मॉडल, उच्च तर्कशक्ति और Python टूल एक्सेस के साथ, FrontierMath बेंचमार्क पर 32% स्कोर हासिल करता है। हालांकि, Epoch की आधिकारिक स्वतंत्र मूल्यांकन रिपोर्ट में केवल 11% का काफी कम स्कोर बताया गया है।

  • Epoch ने बेंचमार्क बनाया है और सटीक स्कोरिंग के लिए इसके पास बेहतर प्रेरणाएं हैं।
  • OpenAI ने सबसे कठिन समस्या स्तर पर 28% स्कोर की रिपोर्ट दी, जो अपने समग्र स्कोर के साथ शंकास्पद रूप से करीब है।
  • Epoch ने अपनी परीक्षण बुनियादी ढांचे और डेटा के बारे में विस्तृत जानकारी प्रकाशित की है, जबकि OpenAI ने बहुत कम प्रकाशित किया है।
  • असंगति इस कारण हो सकती है कि OpenAI अधिक शक्तिशाली आंतरिक स्केफोल्ड, अधिक परीक्षण-समय कंप्यूटेशन या समस्याओं के अलग उपसमुच्चय (180 बनाम 290) का उपयोग कर रहा है।

परिणामों में यह अंतर बड़े भाषा मॉडल के बेंचमार्किंग में पारदर्शी मूल्यांकन विधियों और स्वतंत्र सत्यापन के महत्व को उजागर करता है।