Benchmark · math

GSM8K

saturated 11 परिणाम 10 मॉडल

GSM8K (Grade School Math 8K) प्राथमिक स्तर की गणित की शब्द-समस्याओं का एक benchmark है, जिनमें से हर एक को हल करने के लिए कई चरणों वाले अंकगणितीय तर्क की ज़रूरत होती है; मॉडल को उन समस्याओं के प्रतिशत पर अंक मिलते हैं जिनका अंतिम संख्यात्मक उत्तर सही होता है।

और पढ़ें
उदाहरण
एक छोटी शब्द-समस्या जैसे «Natalia ने अप्रैल में 48 सहेलियों को क्लिप बेचे और मई में उसका आधा; उसने कुल कितने क्लिप बेचे?» — मॉडल को चरण-दर-चरण हल करके अंतिम संख्या देनी होती है।
स्कोरिंग
अंक accuracy (सटीकता) है: उन समस्याओं का अनुपात जिनका अंतिम संख्यात्मक उत्तर संदर्भ उत्तर से बिल्कुल मेल खाता है; बीच का तर्क नहीं आँका जाता, केवल अंतिम संख्या।
सत्यापन
सत्यापन स्वचालित और exact-match होता है: मॉडल की अंतिम संख्या को (आमतौर पर «####» जैसे विभाजक के बाद) निकाला जाता है और सही उत्तर से मिलाया जाता है, इसलिए किसी मानवीय निर्णय की ज़रूरत नहीं होती।
यह क्यों मायने रखता है
यह बहु-चरणीय तर्क का एक मानक और आसानी से जाँचा जाने वाला परीक्षण बन गया, और लोकप्रिय chain-of-thought प्रॉम्प्टिंग तकनीक ने इस पर परिणाम काफ़ी बेहतर किए, जिससे यह तर्क-क्षमता मापने का एक आम पैमाना बन गया।
हल किया गया उदाहरण
कार्य
मारिया के पास 3 डिब्बे क्रेयॉन हैं, हर डिब्बे में 24 क्रेयॉन हैं। वह अपने भाई को 15 क्रेयॉन देती है, फिर 2 और भरे हुए डिब्बे खरीदती है। अब उसके पास कितने क्रेयॉन हैं?
समाधान
3 × 24 = 72; 72 − 15 = 57; 2 × 24 = 48; 57 + 48 = 105 → 105
व्याख्या
शुरुआती संख्या पाने के लिए गुणा करें, दिए गए क्रेयॉन घटाएँ, और नए खरीदे डिब्बे जोड़ें: 72 − 15 + 48 = 105। GSM8K केवल '####' विभाजक के बाद निकाली गई अंतिम संख्या को सटीक मिलान से आँकता है, इसलिए तर्क के चरण नहीं आँके जाते — केवल 105 गिना जाता है।
0 25 50 75 100 2023-03-14 2024-11-18 2026-07-26 Grok-1.5 · 90 · 2024-03-28 DUP method · 97.1 · 2024-04-23 Claude 3.5 Sonnet · 91.6 · 2024-06-20 Qwen2-72B · 89.5 · 2024-07-15 Qwen2-72B · 89.5 · 2024-07-15 Falcon3-10B-Base · 83 · 2024-12-17 Falcon3-7B-Base · 79.1 · 2024-12-17 Falcon3-10B-Instruct · 83.1 · 2024-12-17 Gemma-4-12B · 86 · 2026-07-13 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 · 74.2 · 2026-07-26 GPT-4 · 92 · 2023-03-14
Grok-1.5 DUP method Claude 3.5 Sonnet Qwen2-72B Falcon3-10B-Base Falcon3-7B-Base Falcon3-10B-Instruct Gemma-4-12B Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 GPT-4
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-07-26 Qwen/Qwen2.5-7B-Instruct@a09a35458c702b33eeacc393d103063234e8bc28 74.219% CrowdTensor ने स्वैच्छिक-प्रशिक्षण बीटा और ड्राफ्ट Qwen2.5-7B GSM8K अभियान RFC लॉन्च किया
2026-07-13 Gemma-4-12B 86.0% फ्लिंट सटीकता बनाए रखते हुए टोकन उपयोग कम करने के लिए तर्क ट्रेस को संकुचित करता है
2024-12-17 Falcon3-10B-Base 83.0% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-7B-Base 79.1% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-10B-Instruct 83.1% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-07-15 Qwen2-72B 89.5% Qwen टीम ने 72B डेंस और MoE मॉडल के साथ Qwen2 सीरीज जारी की
2024-07-15 Qwen2-72B 89.5% Qwen2 तकनीकी रिपोर्ट में 72B तक घन और MoE मॉडल पेश किए गए
2024-06-20 Claude 3.5 Sonnet 91.6% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया
2024-04-23 DUP method 97.1% समस्याओं को गहराई से समझने का तरीका GSM8K पर 97.1% हासिल करता है
2024-03-28 Grok-1.5 90.0% xAI ने बेहतर तर्कशक्ति और 128K संदर्भ के साथ Grok-1.5 जारी किया
2023-03-14 GPT-4 92.0% OpenAI