Epoch AI द्वारा जारी स्वतंत्र बेंचमार्क परिणाम दिखाते हैं कि OpenAI के सार्वजनिक रूप से लॉन्च किए गए o3 मॉडल ने FrontierMath डेटासेट पर लगभग 10% स्कोर हासिल किया, जो कंपनी द्वारा दिसंबर में अपनी अनावरण के दौरान उजागर किए गए 25% से अधिक स्कोर से काफी कम है।

  • Epoch AI ने FrontierMath बेंचमार्क के अपडेटेड संस्करण का उपयोग करके जारी o3 मॉडल का मूल्यांकन किया और लगभग 10% का स्कोर पाया।
  • OpenAI द्वारा 25% से अधिक का शुरुआती दावा सार्वजनिक रिलीज की तुलना में अधिक शक्तिशाली आंतरिक स्कैफोल्ड पर एग्रेशनिव टेस्ट-टाइम कंप्यूट सेटिंग्स का उपयोग करके हासिल किया गया था।
  • ARC Prize Foundation ने पुष्टि की कि सार्वजनिक o3 चैट और उत्पाद उपयोग के लिए ट्यून किया गया है, जिसमें उस प्रीव्यू संस्करण की तुलना में छोटे कंप्यूट टियर्स हैं जिसे उन्होंने परखा था।
  • OpenAI के तकनीकी कर्मचारियों ने कहा कि उत्पादन मॉडल अधिकतम बेंचमार्क प्रदर्शन के बजाय लागत-कुशलता और गति के लिए अनुकूलित है।

यह असंगति तृतीय-पक्ष बेंचमार्कों की पुष्टि करने के महत्व को उजागर करती है और स्पष्ट करती है कि जारी मॉडल शीर्ष अकादमिक स्कोर के बजाय वास्तविक दुनिया की उपयोगिता को प्राथमिकता देता है।