OpenAI का नया भाषा मॉडल, o3, Epoch AI द्वारा तैयार की गई सैकड़ों कठिन गणितीय प्रश्नों के एक गुप्त डेटासेट FrontierMath पर 25% स्कोर प्राप्त करता है। इस डेटासेट में वे समस्याएं शामिल हैं जिनके निश्चित, कंप्यूटेबल उत्तर होते हैं जिन्हें स्वचालित रूप से सत्यापित किया जा सकता है; यह मॉडल्स को सार्वजनिक समाधानों को बस याद करने से रोकने के लिए डिज़ाइन किया गया है।

  • FrontierMath में "सैकड़ों" कठिन गणित प्रश्न हैं, जिनमें से शुरू में 200 से कम जारी किए गए थे और बाद में और जोड़े गए।
  • पांच सार्वजनिक नमूना समस्याओं के लिए धनात्मक पूर्णांक उत्तर की आवश्यकता होती है, जैसे कि 9811 और 367707, और इनमें p-adic continuity और Weil conjectures जैसे जटिल अवधारणाएं शामिल हैं।
  • जबकि लेखक ने अपने अंकगणित में विशेषज्ञता का उपयोग करके पांच सार्वजनिक प्रश्नों में से दो को हल किया था, उन्होंने नोट किया कि एक सामान्य स्मार्ट गणित स्नातक छात्र शायद एक में भी संघर्ष करेगा।
  • Epoch AI के Elliot Glazer ने सुझाव दिया कि डेटासेट का 25% हिस्सा "IMO/स्नातक स्तर की समस्याओं" का है, जिसने सार्वजनिक नमूनों की समग्र कठिनाई और प्रतिनिधित्व के बारे में प्रश्न उठाए हैं।

यह उपलब्धि महत्वपूर्ण है क्योंकि गणित के लिए AI क्षेत्र में कठिन डेटासेट की कमी है, और ऐसे बेंचमार्क बनाना कठिन और महंगा है। लेखक ने स्कोर पर आश्चर्य व्यक्त किया, यह नोट करते हुए कि हालांकि AI ओलंपियाड-शैली समस्याओं पर तेजी से सुधार कर रहा है, उन्नत स्नातक या पीएचडी-स्तर की नवाचार तक पहुंच को पहले एक दूर का लक्ष्य माना जाता था।