OpenAI ने एक गैर-सूचना प्रकटीकरण समझौते के तहत स्वतंत्र गणितीय बेंचमार्क FrontierMath को वित्त पोषण प्रदान किया, जिसने Epoch AI को इस संबंध को प्रकटीकरण करने से रोका जब तक कि OpenAI ने अपने o3 मॉडल के रिकॉर्ड तोड़ने वाले प्रदर्शन की घोषणा नहीं कर दी। 60 से अधिक गणितज्ञों द्वारा विकसित इस बेंचमार्क में जटिल तर्क कौशलों का परीक्षण किया जाता है, और OpenAI का o3 इसमें 25.2 प्रतिशत सफलता दर हासिल करने में सक्षम रहा।

  • FrontierMath को नवंबर 2024 में उन्नत गणितीय समस्या-समाधान क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था।
  • Epoch AI ने एक समझौते पर हस्ताक्षर किए जो December 20 को o3 की घोषणा तक OpenAI के वित्तीय समर्थन के प्रकटीकरण को रोकता है।
  • बेंचमार्क समस्याएं 60 से अधिक अग्रणी गणितज्ञों की टीम द्वारा बनाई गई थीं, जिन्हें फंडिंग स्रोत के बारे में नहीं पता था।
  • OpenAI को "बहुत सारा लेकिन सभी नहीं" FrontierMath डेटा तक पहुंच मिली, हालांकि एक मौखिक समझौते ने मॉडल प्रशिक्षण के लिए सामग्रियों का उपयोग करने पर रोक लगा दी थी।
  • Epoch AI पारदर्शिता की कमी को एक गलती मानता है और भविष्य के सहयोगों में फंडिंग स्रोतों के बारे में अधिक स्पष्ट जानकारी देने का वादा करता है।

यह स्थिति AI बेंचमार्किंग की जटिलता और पारदर्शिता के महत्व को उजागर करती है, खासकर क्योंकि गणितीय तर्क भाषा मॉडलों के लिए एक प्रमुख कमजोरी है।