Benchmark · math

AIME 2025

32 परिणाम 28 मॉडल

AIME 2025, 2025 के American Invitational Mathematics Examination (एक कठिन हाई-स्कूल गणित प्रतियोगिता) के 15 प्रश्नों के ज़रिए किसी मॉडल की उन्नत गणितीय तर्क-क्षमता को परखता है। हर उत्तर 0 से 999 के बीच का पूर्णांक होता है, और मॉडल का स्कोर सही हल किए गए प्रश्नों का प्रतिशत होता है (अक्सर pass@1 या avg@k के रूप में बताया जाता है)।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न एक चुनौतीपूर्ण प्रतियोगिता-समस्या होती है — जैसे संख्या-सिद्धांत या क्रमचय-संचय की — जिसका उत्तर 0 से 999 के बीच का एक ही पूर्णांक होता है, उदाहरण के लिए दी गई बीजगणितीय शर्तों को पूरा करने वाले क्रमित युग्मों की संख्या ज्ञात करना।
स्कोरिंग
15 में से हर प्रश्न को उसके पूर्णांक उत्तर के सटीक मिलान से आँका जाता है, और स्कोर सही हल किए गए प्रश्नों का अंश (प्रतिशत) होता है; चूँकि उत्तर हर बार बदल सकते हैं, परिणाम आमतौर पर कई नमूनों पर औसत (avg@k) निकालकर या pass@1 के रूप में बताए जाते हैं।
सत्यापन
जाँच स्वचालित और वस्तुनिष्ठ होती है: मॉडल के अंतिम पूर्णांक की तुलना आधिकारिक उत्तर-कुंजी से की जाती है, न कोई आंशिक अंक और न कोई मानवीय मूल्यांकन, इसलिए किसी हल को केवल सटीक संख्यात्मक मिलान पर ही स्वीकार किया जाता है।
यह क्यों मायने रखता है
AIME की समस्याएँ रटने के बजाय बहु-चरणीय, रचनात्मक तर्क की माँग करती हैं, इसलिए यह बेंचमार्क अग्रणी LLM की गणितीय क्षमता का व्यापक रूप से देखा जाने वाला माप है और नए रीज़निंग मॉडल जारी होने पर अक्सर सुर्खियों में रहने वाला आँकड़ा है।
हल किया गया उदाहरण
कार्य
AIME शैली का प्रतिनिधि प्रश्न (उत्तर 0 से 999 तक का पूर्णांक है): उन सभी धनात्मक पूर्णांकों n का योग ज्ञात कीजिए जिनके लिए √(n² + 85n + 2017) एक पूर्णांक है।
समाधान
पूर्ण वर्ग बनाइए: (2m)² − (2n+85)² = 843 = 3·281। वर्गों का अंतर गुणनखंडित कीजिए: (2m−2n−85)(2m+2n+85) = 843, जिससे n = 168 या n = 27। योग = 168 + 27 = 195।
व्याख्या
पूर्ण वर्ग बनाने से शर्त वर्गों के अंतर (2m)² − (2n+85)² = 843 = 3·281 में बदल जाती है, जिसके एकमात्र धनात्मक गुणनखंड n = 168 और n = 27 देते हैं, जिनका योग 195 है। AIME को एकमात्र पूर्णांक उत्तर (0–999) के सटीक मिलान से जांचा जाता है, कोई आंशिक अंक नहीं।
0 25 50 75 100 2025-01-22 2025-11-14 2026-09-07 Kimi k1.5 · 77.5 · 2025-01-22 Kimi k1.5 (short-CoT) · 60.8 · 2025-01-22 Grok 3 (Think) · 93.3 · 2025-02-19 Grok 3 Beta · 93.3 · 2025-02-26 Claude 3.7 Sonnet · 61.3 · 2025-02-26 Claude 3.5 Sonnet · 41.3 · 2025-02-26 OpenAI o3-mini · 83.3 · 2025-02-26 DeepSeek R1 · 79.8 · 2025-02-26 Grok 3 · 93.3 · 2025-03-11 Gemini 2.5 Pro (experimental) · 86.7 · 2025-03-25 Gemini 2.5 Pro · 86.7 · 2025-03-26 OpenAI o4-mini · 99.5 · 2025-04-16 OpenAI o3 · 98.4 · 2025-04-16 o4-mini · 92.7 · 2025-04-17 Qwen3-235B-A22B · 81.5 · 2025-05-14 DeepSeek-R1-0528 · 87.5 · 2025-05-28 Deepseek-R1-0528 · 87.5 · 2025-05-30 Grok 4 · 88 · 2025-07-25 Kimi K2 · 49.5 · 2025-07-28 Kimi K2 · 49.5 · 2025-07-28 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GPT-5 · 94.6 · 2025-08-07 GLM-4.6 · 93.9 · 2025-09-30 Claude Sonnet 4.5 · 100 · 2025-09-30 Kimi K2.5 · 96.1 · 2026-01-27 o1-pro · 86 · 2026-05-14 DASH · 50.8 · 2026-07-05 Agents-A1 · 79 · 2026-07-06 Mach-Mind-4-Flash · 92.7 · 2026-07-13 Mach-Mind-4-Flash · 92.7 · 2026-07-13 K2-Horizon-0.9B · 48.5 · 2026-09-07
Kimi k1.5 Kimi k1.5 (short-CoT) Grok 3 (Think) Grok 3 Beta Claude 3.7 Sonnet Claude 3.5 Sonnet OpenAI o3-mini DeepSeek R1 Grok 3 Gemini 2.5 Pro (experimental) Gemini 2.5 Pro OpenAI o4-mini OpenAI o3 o4-mini Qwen3-235B-A22B DeepSeek-R1-0528 Deepseek-R1-0528 Grok 4 Kimi K2 GPT-5 GLM-4.6 Claude Sonnet 4.5 Kimi K2.5 o1-pro DASH Agents-A1 Mach-Mind-4-Flash K2-Horizon-0.9B
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-09-07 K2-Horizon-0.9B 48.5% IFM ने K2 Horizon जारी किया: 0.9B से 375B तक के छह Apache 2.0 मॉडल
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-13 Mach-Mind-4-Flash 92.7% Mach-Mind-4-Flash: पोस्ट-ट्रेनिंग ऑप्टिमाइज़ेशन के माध्यम से 35B MoE एजेंटिक मॉडल बड़े मॉडल्स के बराबर
2026-07-06 Agents-A1 79.0pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2026-07-05 DASH 50.8% खंड-स्तर क्रेडिट असाइनमेंट के माध्यम से तर्क भाषा मॉडल में अति-विचारशीलता को कम करता है DASH
2026-05-14 o1-pro 86.0% OpenAI ने इनफरेंस-टाइम कंप्यूट के साथ रीजनिंग युग की स्थापना करते हुए o1 फैमिली जारी की
2026-01-27 Kimi K2.5 96.1% Moonshot ने Agent Swarm तकनीक के साथ Kimi K2.5 जारी किया
2025-09-30 GLM-4.6 93.9% Zhipu AI ने एजेंटिक क्षमताओं और 128k संदर्भ विंडो के साथ GLM-4.6 जारी किया
2025-09-30 Claude Sonnet 4.5 100.0% Anthropic ने कोडिंग और एजेंट क्षमताओं में सुधार के साथ Claude Sonnet 4.5 जारी किया
2025-08-07 GPT-5 94.6% ओपनएआई ने अनुकूलित तर्कशक्ति और एकीकृत वास्तुकला के साथ GPT-5 लॉन्च किया
2025-08-07 GPT-5 94.6% OpenAI ने एकत्रीकृत रूटिंग और विशेषज्ञ-स्तरीय तर्क के साथ GPT-5 पेश किया
2025-08-07 GPT-5 94.6% OpenAI
2025-07-28 Kimi K2 49.5% Moonshot ने Kimi K2 जारी किया, जो 32B सक्रिय पैरामीटर के साथ एक ओपन एजेंटिक MoE मॉडल है
2025-07-28 Kimi K2 49.5% Kimi K2: 1T पैरामीटर और MuonClip ऑप्टिमाइज़र के साथ ओपन MoE मॉडल
2025-07-25 Grok 4 88.0% Epoch AI ने Grok 4 की गणितीय क्षमताओं का मूल्यांकन किया
2025-05-30 Deepseek-R1-0528 87.5% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-28 DeepSeek-R1-0528 87.5% DeepSeek-R1-0528 तर्कशक्ति और AIME सटीकता को 87.5% तक बढ़ाता है
2025-05-14 Qwen3-235B-A22B 81.5% Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-17 o4-mini 92.7% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-16 OpenAI o4-mini 99.5% OpenAI ने एजेंटिक टूल उपयोग के साथ o3 और o4-mini तर्क मॉडल जारी किए
2025-04-16 OpenAI o3 98.4% OpenAI ने एजेंटिक टूल उपयोग के साथ o3 और o4-mini तर्क मॉडल जारी किए
2025-03-26 Gemini 2.5 Pro 86.7% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-25 Gemini 2.5 Pro (experimental) 86.7% Google DeepMind ने Gemini 2.5 Pro एक्सपेरिमेंटल मॉडल जारी किया
2025-03-11 Grok 3 93.3% xAI ने गहरा तर्क और मिलियन-टोकन संदर्भ के साथ Grok 3 जारी किया
2025-02-26 Grok 3 Beta 93.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.7 Sonnet 61.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.5 Sonnet 41.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 OpenAI o3-mini 83.3% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 DeepSeek R1 79.8% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-19 Grok 3 (Think) 93.3% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-01-22 Kimi k1.5 77.5% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2025-01-22 Kimi k1.5 (short-CoT) 60.8% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है