Epoch AI ने FrontierMath पेश किया है, जो सैकड़ों मौलिक, विशेषज्ञ द्वारा तैयार किए गए गणित के प्रश्नों से बना एक बेंचमार्क है जिसे AI सिस्टम में उन्नत तर्क क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है। फील्ड्स पदक विजेता सहित 60 से अधिक गणितज्ञों के साथ सहयोग में विकसित, ये प्रश्न संख्या सिद्धांत और बीजगणितीय ज्यामिति जैसे आधुनिक शोध क्षेत्रों को कवर करते हैं, जिनके हल करने में विशेषज्ञों को आमतौर पर घंटों या दिन लगते हैं।
- इस बेंचमार्क में ऐसे प्रश्न शामिल हैं जो "guessproof" हैं और गणना के माध्यम से स्वचालित रूप से सत्यापनीय हैं।
- Claude 3.5 Sonnet और GPT-4o सहित छह प्रमुख मॉडल का मूल्यांकन करने पर, व्यापक समर्थन ढांचे के बावजूद किसी ने भी 2% से अधिक प्रश्नों को हल नहीं किया।
- यह प्रदर्शन GSM-8K जैसे बेंचमार्क्स के साथ तीव्र विरोधाभास दर्शाता है, जहाँ शीर्ष मॉडल 90% से अधिक सटीकता हासिल करते हैं।
- Epoch AI आने वाले महीनों में नियमित मूल्यांकन करना, बेंचमार्क का विस्तार करना और अतिरिक्त प्रश्न जारी करने की योजना बना रहा है।
FrontierMath का उद्देश्य AI सिस्टम के उन्नत होने के साथ शोध-स्तर की गणितीय तर्क क्षमता में प्रगति का एक मानकीकृत माप प्रदान करना है, जो वर्तमान AI क्षमताओं और विशेषज्ञ गणितज्ञों के बीच एक महत्वपूर्ण अंतर को रेखांकित करता है।