Benchmark · math

FrontierMath

20 परिणाम 15 मॉडल

FrontierMath, Epoch AI का एक बेंचमार्क है जो मापता है कि कोई AI मॉडल बेहद कठिन, मौलिक और शोध-स्तर की गणितीय समस्याओं को कितनी अच्छी तरह हल कर सकता है। स्कोर उन समस्याओं का प्रतिशत है जिनका मॉडल सही उत्तर देता है, और आज के मॉडल केवल एक छोटा-सा हिस्सा ही हल कर पाते हैं — संतृप्ति से बहुत दूर।

और पढ़ें
उदाहरण
संख्या सिद्धांत (number theory), बीजगणितीय ज्यामिति या कॉम्बिनेटरिक्स जैसे उन्नत क्षेत्र की एक अकेली, पहले कभी प्रकाशित न हुई समस्या, जिसका हल गहरी विशेषज्ञता माँगता है और अंत में एक निश्चित उत्तर तक सिमट जाता है (उदाहरण के लिए कोई विशिष्ट पूर्णांक या सटीक गणितीय वस्तु)।
स्कोरिंग
मापदंड है सटीकता (accuracy): उन समस्याओं का अनुपात जिनका अंतिम उत्तर संदर्भ उत्तर से बिल्कुल मेल खाता है, प्रतिशत में व्यक्त किया जाता है।
सत्यापन
हर समस्या का एक ही निश्चित, स्वतः जाँचा जा सकने वाला उत्तर होता है, इसलिए कोई हल तभी स्वीकार होता है जब वह संदर्भ उत्तर से हूबहू मेल खाए; समस्याओं को विशेषज्ञ गणितज्ञ इस तरह बनाते हैं कि अनुमान लगाकर सही उत्तर पाना लगभग असंभव हो।
यह क्यों मायने रखता है
चूँकि समस्याएँ नई होती हैं, यह रटने से बच निकलता है, और अब भी हल होने से बहुत दूर है, इसलिए यह उन गिने-चुने गणित बेंचमार्क में से एक है जो असली उन्नत गणितीय तर्क को पैटर्न-मिलान से साफ़ अलग कर देता है।
हल किया गया उदाहरण
कार्य
उन पूर्णांकों $n$ की संख्या ज्ञात कीजिए जिनके लिए $0 \le n < 3^{13}$ हो और केंद्रीय द्विपद गुणांक $\binom{2n}{n}$ , $3$ से विभाज्य न हो।
समाधान
Kummer प्रमेय के अनुसार, $3 \nmid \binom{2n}{n}$ ठीक तभी होता है जब आधार 3 में $n+n$ जोड़ने पर कोई हासिल (carry) न हो, अर्थात् $n$ का प्रत्येक आधार-3 अंक 0 या 1 हो। $0 \le n < 3^{13}$ पर इससे 13 में से हर अंक के लिए 2 विकल्प मिलते हैं, इसलिए गिनती $2^{13} = 8192$ है।
व्याख्या
Kummer प्रमेय $v_3\binom{2n}{n}$ को आधार 3 में $n$ को स्वयं से जोड़ने पर आने वाले हासिल की संख्या के बराबर देता है; शून्य हासिल के लिए प्रत्येक आधार-3 अंक का 0 या 1 होना आवश्यक है, अर्थात् 13 अंकों में प्रति अंक 2 विकल्प। मूल्यांकन: एक स्वचालित जाँचक एकमात्र अंतिम पूर्णांक (8192) का सटीक मिलान करता है।
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-04-25 GPT-5.5 51.7% OpenAI ने GPT-5.5 जारी किया, एक नई आधार से पुनः प्रशिक्षित मॉडल जिसमें मूल ओमिमोडल प्रोसेसिंग है
2026-04-23 GPT-5.5 Pro 39.6% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-04-23 GPT-5.5 35.4% ओपनएआई ने एजेंटिक क्षमताओं और दोगुनी एपीआई मूल्य निर्धारण के साथ जीपीटी-5.5 जारी की
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro ने FrontierMath Tier 4 पर 31% स्कोर हासिल किया
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI ने विज्ञान और गणित के लिए GPT-5.2 Pro और Thinking मॉडल जारी किए
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI ने Frontier Data Centers Hub लॉन्च किया और OSWorld benchmark का विश्लेषण किया
2025-12-04 Gemini 3 Pro 38.0% Epoch AI ने Frontier Data Centers Hub लॉन्च किया और OSWorld benchmark का विश्लेषण किया
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro ने FrontierMath Tier 4 की नई समस्या को हल किया, Gemini 2.5 Deep Think से आगे
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI ने Gemini 2.5 Deep Think की गणितीय क्षमताओं का मूल्यांकन किया
2025-04-20 o3 10.0% OpenAI का o3 FrontierMath पर शुरुआती दावे से कम स्कोर करता है
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% FrontierMath पर o3-mini के Epoch के मूल्यांकन में 11% बनाम OpenAI का 32%
2025-01-29 o3 25.0% OpenAI का o3 मॉडल Frontier Math बेंचमार्क पर 25% स्कोर हासिल करता है
2025-01-19 o3 25.2% OpenAI ने o3 द्वारा रिकॉर्ड तोड़ने से पहले FrontierMath बेंचमार्क को फंडिंग दी
2024-12-22 o3 25.0% OpenAI का o3 FrontierMath कठिन गणित बेंचमार्क पर 25% स्कोर प्राप्त करता है
2024-12-20 o3 25.0% OpenAI ने ARC AGI और Frontier Math में सफलता के साथ o3 तर्क मॉडल का प्रीव्यू दिया
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI ने उन्नत गणितीय तर्क का मूल्यांकन करने के लिए FrontierMath बेंचमार्क जारी किया
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI ने उन्नत गणितीय तर्क का मूल्यांकन करने के लिए FrontierMath बेंचमार्क जारी किया
2024-11-08 GPT-4o 2.0% Epoch AI ने उन्नत गणितीय तर्क का मूल्यांकन करने के लिए FrontierMath बेंचमार्क जारी किया
2024-11-08 o1-preview 2.0% Epoch AI ने उन्नत गणितीय तर्क का मूल्यांकन करने के लिए FrontierMath बेंचमार्क जारी किया