Benchmark · math

AIME 2024

30 परिणाम 27 मॉडल

AIME 2024, 2024 के American Invitational Mathematics Examination के 15 प्रश्नों के ज़रिए किसी मॉडल की उन्नत गणितीय तर्कक्षमता मापता है और सही हल किए गए प्रश्नों का प्रतिशत बताता है।

और पढ़ें
उदाहरण
एक सामान्य प्रश्न स्कूल-स्तर की कठिन प्रतियोगिता का होता है — जैसे संख्या-सिद्धांत या combinatorics का प्रश्न — जिसका उत्तर एक ही पूर्णांक होता है (AIME में उत्तर हमेशा पूर्णांक होता है, आमतौर पर 0 से 999 के बीच)।
स्कोरिंग
मापदंड है accuracy: 15 में से सही उत्तर दिए गए प्रश्नों का अनुपात, यानी हर सही हल किया गया प्रश्न कुल अंक का 1/15 होता है।
सत्यापन
परिणाम exact match से स्वीकार किया जाता है: मॉडल का अंतिम पूर्णांक उत्तर आधिकारिक उत्तर के बराबर होना चाहिए, जिसे स्वचालित रूप से जाँचा जाता है — न कोई आंशिक अंक, न कोई मानवीय मूल्यांकन।
यह क्यों मायने रखता है
यह कठिन और हाल के प्रतियोगिता प्रश्नों का एक संक्षिप्त समूह है जिसमें कई चरणों का तर्क चाहिए, इसलिए इसे अग्रणी मॉडलों की तुलना के लिए व्यापक रूप से इस्तेमाल किया जाता है, और प्रश्नों की नवीनता प्रशिक्षण-डेटा संदूषण का जोखिम घटाती है।
हल किया गया उदाहरण
कार्य
कितने धनात्मक पूर्णांक n ≤ 600 ऐसे हैं जो 4 या 6 से विभाज्य हैं परंतु 5 से नहीं? (AIME के उत्तर 0 से 999 तक के पूर्णांक होते हैं।)
समाधान
Multiples of 4 or 6 that are ≤ 600: 150 + 100 − 50 = 200. Of these, the ones also divisible by 5 (multiples of 20 or 30, minus 60): 30 + 20 − 10 = 40. Answer: 200 − 40 = 160.
व्याख्या
समावेशन-अपवर्जन (inclusion–exclusion) से 4 या 6 से विभाज्य 200 संख्याएँ हैं, जिनमें से 40 संख्याएँ 5 से भी विभाज्य हैं, अतः 160 शेष रहती हैं। AIME केवल अंतिम पूर्णांक उत्तर (0–999) की स्वतः जाँच करता है, आंशिक अंक नहीं देता।
0 25 50 75 100 2024-09-12 2025-08-09 2026-07-07 o1 · 13.9 · 2024-09-12 OpenAI o1-preview · 83 · 2024-10-01 QwQ-32B-Preview · 50 · 2024-11-28 o3 · 96.7 · 2024-12-20 o3 · 96.7 · 2026-03-25 DeepSeek-R1-Distill-Qwen-7B · 55.5 · 2025-01-22 DeepSeek-R1-Zero · 71 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 72.6 · 2025-01-22 DeepSeek-R1 · 79.8 · 2025-01-22 s1-32B · 57 · 2025-01-31 s1-32B · 57 · 2025-01-31 LIMO · 57.1 · 2025-02-05 Grok 3 mini · 95.8 · 2025-02-19 Claude 3.7 Sonnet · 80 · 2025-02-24 GPT-4.5 · 36.7 · 2025-03-05 DeepSeek-V3-0324 · 59.4 · 2025-03-24 Gemini 2.5 Pro · 92 · 2025-03-26 Seed1.5-Thinking · 86.7 · 2025-04-10 o4-mini · 93.4 · 2025-04-17 Qwen3-235B-A22B · 85.7 · 2025-05-14 Deepseek-R1-0528-Qwen3-8B · 86 · 2025-05-30 Deepseek-R1-0528 · 91.4 · 2025-05-30 Magistral Small · 70.7 · 2025-06-10 Magistral Medium · 73.6 · 2025-06-10 Magistral Medium · 50 · 2025-06-12 GLM-4.5 · 91 · 2025-08-06 GLM-4.5-Air · 89.4 · 2025-08-06 Qwen3-1.7B · 62.4 · 2026-07-07 DeepSeek R1 · 79.8 · 2025-01-20 OpenAI o3 · 91.6 · 2025-04-16
o1 OpenAI o1-preview QwQ-32B-Preview o3 DeepSeek-R1-Distill-Qwen-7B DeepSeek-R1-Zero DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 s1-32B LIMO Grok 3 mini Claude 3.7 Sonnet GPT-4.5 DeepSeek-V3-0324 Gemini 2.5 Pro Seed1.5-Thinking o4-mini Qwen3-235B-A22B Deepseek-R1-0528-Qwen3-8B Deepseek-R1-0528 Magistral Small Magistral Medium GLM-4.5 GLM-4.5-Air Qwen3-1.7B DeepSeek R1 OpenAI o3
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-07 Qwen3-1.7B 62.4% Direct-OPD कमजोर-से-मजबूत RL लाभों को मजबूत मॉडलों के लिए डिस्टिल करता है
2026-03-25 o3 96.7% OpenAI ने ChatGPT से o3 को निष्क्रिय करने की घोषणा की और बेंचमार्क स्कोर साझा किए
2025-08-06 GLM-4.5 91.0% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-08-06 GLM-4.5-Air 89.4% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-06-12 Magistral Medium 50.0% मिस्ट्रल ने स्केलेबल RL पाइपलाइन के साथ मैजिस्ट्रल रीज़निंग मॉडल पेश किए
2025-06-10 Magistral Small 70.7% मिस्ट्रल एआई ने ओपन और एंटरप्राइज वेरिएंट्स के साथ मैजिस्ट्रल रीजनिंग मॉडल जारी किया
2025-06-10 Magistral Medium 73.6% मिस्ट्रल एआई ने ओपन और एंटरप्राइज वेरिएंट्स के साथ मैजिस्ट्रल रीजनिंग मॉडल जारी किया
2025-05-30 Deepseek-R1-0528-Qwen3-8B 86.0% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-30 Deepseek-R1-0528 91.4% DeepSeek ने R1 मॉडल को बेहतर तर्कशक्ति और बेंचमार्क स्कोर के साथ अपडेट किया
2025-05-14 Qwen3-235B-A22B 85.7% Qwen3 में एकीकृत चिंतन मोड और 119 भाषाओं का समर्थन पेश
2025-04-17 o4-mini 93.4% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2025-04-16 OpenAI o3 91.6% OpenAI
2025-04-10 Seed1.5-Thinking 86.7% Seed1.5-Thinking तर्क को बेहतर बनाने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करता है
2025-03-26 Gemini 2.5 Pro 92.0% गूगल ने 1M टोकन संदर्भ के साथ एक्सपेरिमेंटल जेमिनी 2.5 प्रो रीजनिंग मॉडल जारी किया
2025-03-24 DeepSeek-V3-0324 59.4% DeepSeek-V3-0324 ने DeepSeek-V3 की तुलना में तर्कशक्ति, कोडिंग और चीनी लेखन में सुधार किया है
2025-03-05 GPT-4.5 36.7% OpenAI ने ChatGPT Plus के लिए अपना सबसे बड़ा मॉडल GPT-4.5 जारी किया
2025-02-24 Claude 3.7 Sonnet 80.0% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2025-02-19 Grok 3 mini 95.8% xAI ने Grok 3 बीटा और DeepSearch एजेंट जारी किया
2025-02-05 LIMO 57.1% GAIR-NLP ने LIMO जारी किया, 817 नमूनों के साथ मजबूत गणितीय तर्क प्राप्त किया
2025-01-31 s1-32B 57.0% सिंपल स्केलिंग लैब ने बजट फोर्सिंग के माध्यम से टेस्ट-टाइम स्केलिंग के साथ s1-32B जारी किया
2025-01-31 s1-32B 57.0% सरल परीक्षण-समय स्केलिंग का उपयोग करके s1-32B प्रतियोगिता गणित में o1-preview को पार करता है
2025-01-22 DeepSeek-R1-Distill-Qwen-7B 55.5% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-22 DeepSeek-R1-Zero 71.0% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 72.6% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-22 DeepSeek-R1 79.8% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-20 DeepSeek R1 79.8% DeepSeek
2024-12-20 o3 96.7% OpenAI ने तर्क और कोडिंग में उच्च प्रदर्शन के साथ o3 मॉडल जारी किया
2024-11-28 QwQ-32B-Preview 50.0% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-10-01 OpenAI o1-preview 83.0% OpenAI o1 की तुलना अन्य शीर्ष मॉडलों से
2024-09-12 o1 13.9% OpenAI ने गणित और विज्ञान मानकों पर मानवीय विशेषज्ञों को पार करने वाले एक तर्क मॉडल o1-preview को जारी किया