Benchmark · math

AIME 2025

31 परिणाम 27 मॉडल

AIME 2025, 2025 के American Invitational Mathematics Examination (एक कठिन हाई-स्कूल गणित प्रतियोगिता) के 15 प्रश्नों के ज़रिए किसी मॉडल की उन्नत गणितीय तर्क-क्षमता को परखता है। हर उत्तर 0 से 999 के बीच का पूर्णांक होता है, और मॉडल का स्कोर सही हल किए गए प्रश्नों का प्रतिशत होता है (अक्सर pass@1 या avg@k के रूप में बताया जाता है)।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न एक चुनौतीपूर्ण प्रतियोगिता-समस्या होती है — जैसे संख्या-सिद्धांत या क्रमचय-संचय की — जिसका उत्तर 0 से 999 के बीच का एक ही पूर्णांक होता है, उदाहरण के लिए दी गई बीजगणितीय शर्तों को पूरा करने वाले क्रमित युग्मों की संख्या ज्ञात करना।
स्कोरिंग
15 में से हर प्रश्न को उसके पूर्णांक उत्तर के सटीक मिलान से आँका जाता है, और स्कोर सही हल किए गए प्रश्नों का अंश (प्रतिशत) होता है; चूँकि उत्तर हर बार बदल सकते हैं, परिणाम आमतौर पर कई नमूनों पर औसत (avg@k) निकालकर या pass@1 के रूप में बताए जाते हैं।
सत्यापन
जाँच स्वचालित और वस्तुनिष्ठ होती है: मॉडल के अंतिम पूर्णांक की तुलना आधिकारिक उत्तर-कुंजी से की जाती है, न कोई आंशिक अंक और न कोई मानवीय मूल्यांकन, इसलिए किसी हल को केवल सटीक संख्यात्मक मिलान पर ही स्वीकार किया जाता है।
यह क्यों मायने रखता है
AIME की समस्याएँ रटने के बजाय बहु-चरणीय, रचनात्मक तर्क की माँग करती हैं, इसलिए यह बेंचमार्क अग्रणी LLM की गणितीय क्षमता का व्यापक रूप से देखा जाने वाला माप है और नए रीज़निंग मॉडल जारी होने पर अक्सर सुर्खियों में रहने वाला आँकड़ा है।
हल किया गया उदाहरण
कार्य
AIME शैली का प्रतिनिधि प्रश्न (उत्तर 0 से 999 तक का पूर्णांक है): उन सभी धनात्मक पूर्णांकों n का योग ज्ञात कीजिए जिनके लिए √(n² + 85n + 2017) एक पूर्णांक है।
समाधान
पूर्ण वर्ग बनाइए: (2m)² − (2n+85)² = 843 = 3·281। वर्गों का अंतर गुणनखंडित कीजिए: (2m−2n−85)(2m+2n+85) = 843, जिससे n = 168 या n = 27। योग = 168 + 27 = 195।
व्याख्या
पूर्ण वर्ग बनाने से शर्त वर्गों के अंतर (2m)² − (2n+85)² = 843 = 3·281 में बदल जाती है, जिसके एकमात्र धनात्मक गुणनखंड n = 168 और n = 27 देते हैं, जिनका योग 195 है। AIME को एकमात्र पूर्णांक उत्तर (0–999) के सटीक मिलान से जांचा जाता है, कोई आंशिक अंक नहीं।
0 25 50 75 100 2025-01-22 2025-10-17 2026-07-13 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Kimi k1.5 · 77.5 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o3 · 98.4 · 2025-04-16 OpenAI o4-mini · 99.5 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13
Kimi k1.5 (short-CoT) Kimi k1.5 Grok 3 (Think) Grok 3 Beta OpenAI o3-mini DeepSeek R1 Claude 3.7 Sonnet Claude 3.5 Sonnet Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o3 OpenAI o4-mini o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-06 Agents-A1 79.0pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-07-05 DASH 50.8% खंड-स्तर क्रेडिट असाइनमेंट के माध्यम से तर्क भाषा मॉडल में अति-विचारशीलता को कम करता है DASH
2026-05-14 o1-pro 86.0% OpenAI ने इनफरेंस-टाइम कंप्यूट के साथ रीजनिंग युग की स्थापना करते हुए o1 फैमिली जारी की
2026-01-27 Kimi K2.5 96.1% Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
2025-09-30 GLM-4.6 93.9% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-08-07 GPT-5 94.6% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT-5 94.6% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-28 Kimi K2 49.5% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-25 Grok 4 88.0% Epoch AI ने Grok 4 की गणितीय क्षमताओं का मूल्यांकन किया
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 तर्कशक्ति और AIME सटीकता को 87.5% तक बढ़ाता है
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-17 o4-mini 92.7% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-16 OpenAI o3 98.4% OpenAI ने एजेंटिक टूल उपयोग के साथ o3 और o4-mini तर्क मॉडल जारी किए
2025-04-16 OpenAI o4-mini 99.5% OpenAI ने एजेंटिक टूल उपयोग के साथ o3 और o4-mini तर्क मॉडल जारी किए
2025-03-26 Gemini 2.5 Pro 86.7% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
2025-03-11 Grok 3 93.3% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-02-26 Grok 3 Beta 93.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 OpenAI o3-mini 83.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 DeepSeek R1 79.8% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.7 Sonnet 61.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.5 Sonnet 41.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-19 Grok 3 (Think) 93.3% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है