Benchmark · math

MATH-500

saturated 18 परिणाम 17 मॉडल

MATH-500 प्रतियोगिता-गणित डेटासेट MATH का 500 प्रश्नों वाला उपसमुच्चय है, जो किसी मॉडल की कठिन गणितीय समस्याएँ हल करने की क्षमता जाँचता है। स्कोर उन प्रश्नों का प्रतिशत है जिनका अंतिम उत्तर मॉडल सही देता है।

और पढ़ें
उदाहरण
एक विशिष्ट प्रश्न प्रतियोगिता-शैली की गणितीय समस्या होता है — जैसे बीजगणित, ज्यामिति या संख्या-सिद्धांत का कोई प्रश्न, जो कई चरणों के तर्क के बाद एक ही अंतिम उत्तर (कोई संख्या या क्लोज़्ड-फॉर्म व्यंजक) माँगता है।
स्कोरिंग
स्कोर 500 प्रश्नों में से मॉडल द्वारा सही हल किए गए प्रश्नों का अनुपात है, यानी accuracy = सही अंतिम उत्तर / 500, जिसे प्रतिशत में दर्शाया जाता है।
सत्यापन
कोई प्रश्न तभी हल माना जाता है जब मॉडल का अंतिम उत्तर संदर्भ उत्तर से बिल्कुल मेल खाता है (अंतिम उत्तर की स्वचालित समतुल्यता जाँच, न कि बीच के चरणों की)।
यह क्यों मायने रखता है
यह गणितीय तर्कशक्ति का एक संक्षिप्त और व्यापक रूप से प्रयुक्त मापदंड है जो पूरे MATH सेट की तुलना में तेज़ चलता है, इसलिए तर्क करने वाले मॉडलों की तुलना करते समय यह एक आम त्वरित जाँच है।
हल किया गया उदाहरण
कार्य
$k$ के कुछ मानों के लिए, द्विघात समीकरण $x^2 - kx + 16 = 0$ के केवल धनात्मक पूर्णांक मूल होते हैं। $k$ के सभी भिन्न संभावित मानों का योग ज्ञात कीजिए।
समाधान
Roots $r,s$: $rs=16$, $k=r+s$. Pairs $(1,16),(2,8),(4,4)\Rightarrow k\in\{17,10,8\}$. Distinct sum $=17+10+8=\boxed{35}$.
व्याख्या
मूल $r,s$ धनात्मक पूर्णांक हैं जिनमें $rs=16$ और $k=r+s$; गुणनखंड युग्म $(1,16),(2,8),(4,4)$ से $k=17,10,8$ मिलते हैं, अतः भिन्न मानों का योग $35$ है। MATH-500 सामान्यीकृत अंतिम \boxed{} उत्तर के सटीक मिलान से मूल्यांकन करता है, इसलिए केवल $35$ ही मान्य है।
0 25 50 75 100 2024-02-05 2025-04-21 2026-07-07 DeepSeekMath 7B · 51.7 · 2024-02-05 Grok-1.5 · 50.6 · 2024-03-28 Claude 3.5 Sonnet · 71.1 · 2024-06-20 Claude 3.5 Sonnet · 82.2 · 2025-02-26 QwQ-32B-Preview · 90.6 · 2024-11-28 Kimi k1.5 · 96.2 · 2025-01-22 Kimi k1.5 (short-CoT) · 94.6 · 2025-01-22 DeepSeek-R1 · 97.3 · 2025-01-22 DeepSeek-R1-Distill-Qwen-32B · 94.3 · 2025-01-22 LIMO · 94.8 · 2025-02-05 Claude 3.7 Sonnet · 96.2 · 2025-02-26 Gemini 2.0 Flash · 90.9 · 2025-04-15 Phi-4-Mini-Reasoning · 3.2 · 2025-04-30 Llama-8B · 89.1 · 2025-04-30 Qwen-1.5B · 83.9 · 2025-04-30 GLM-4.5 · 98.2 · 2025-08-06 Qwen3.6-27B · 87 · 2026-07-07 Qwen3.6-27B-DFlash · 86 · 2026-07-07
DeepSeekMath 7B Grok-1.5 Claude 3.5 Sonnet QwQ-32B-Preview Kimi k1.5 Kimi k1.5 (short-CoT) DeepSeek-R1 DeepSeek-R1-Distill-Qwen-32B LIMO Claude 3.7 Sonnet Gemini 2.0 Flash Phi-4-Mini-Reasoning Llama-8B Qwen-1.5B GLM-4.5 Qwen3.6-27B Qwen3.6-27B-DFlash
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-07 Qwen3.6-27B 87.0% llama.cpp में DFlash के विलय से Qwen 3.6 27B पर 4.44x गति वृद्धि
2026-07-07 Qwen3.6-27B-DFlash 86.0% llama.cpp में DFlash के विलय से Qwen 3.6 27B पर 4.44x गति वृद्धि
2025-08-06 GLM-4.5 98.2% ज़ीपू एआई ने क्लॉड और डीपसीक के बराबर GLM-4.5 मॉडल जारी किए
2025-04-30 Phi-4-Mini-Reasoning 3.2% माइक्रोसॉफ्ट ने फाई-4-मिनी-रीजनिंग जारी की, एक 3.8B मॉडल जो बड़े तर्क मॉडलों को पछाड़ता है
2025-04-30 Llama-8B 89.1% माइक्रोसॉफ्ट ने फाई-4-मिनी-रीजनिंग जारी की, एक 3.8B मॉडल जो बड़े तर्क मॉडलों को पछाड़ता है
2025-04-30 Qwen-1.5B 83.9% माइक्रोसॉफ्ट ने फाई-4-मिनी-रीजनिंग जारी की, एक 3.8B मॉडल जो बड़े तर्क मॉडलों को पछाड़ता है
2025-04-15 Gemini 2.0 Flash 90.9% गूगल ने गेमिनी 1.5 प्रो की तुलना में दोगुनी गति और बढ़े हुए गुणवत्ता के साथ गेमिनी 2.0 फ्लैश जारी किया
2025-02-26 Claude 3.7 Sonnet 96.2% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-26 Claude 3.5 Sonnet 82.2% क्लाउड 3.7 सॉनेट, o3-mini, R1 और ग्रॉक 3 बीटा का बेंचमार्क तुलना
2025-02-05 LIMO 94.8% GAIR-NLP ने LIMO जारी किया, 817 नमूनों के साथ मजबूत गणितीय तर्क प्राप्त किया
2025-01-22 Kimi k1.5 96.2% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2025-01-22 Kimi k1.5 (short-CoT) 94.6% Kimi k1.5 LLM के साथ पुनर्बल सीखने को स्केल करके o1 से मेल खाता है और short-CoT मॉडल्स को हराता है
2025-01-22 DeepSeek-R1 97.3% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2025-01-22 DeepSeek-R1-Distill-Qwen-32B 94.3% DeepSeek ने रीइन्फोर्समेंट लर्निंग के माध्यम से R1 तर्क मॉडल जारी किए
2024-11-28 QwQ-32B-Preview 90.6% Qwen ने QwQ-32B-Preview जारी किया, एक प्रायोगिक तर्कशील मॉडल
2024-06-20 Claude 3.5 Sonnet 71.1% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-03-28 Grok-1.5 50.6% xAI ने बेहतर तर्कशक्ति और 128K संदर्भ के साथ Grok-1.5 जारी किया
2024-02-05 DeepSeekMath 7B 51.7% DeepSeekMath 7B ने GRPO और चयनित डेटा का उपयोग करके MATH बेंचमार्क पर 51.7% हासिल किया