xAI ने Epoch AI को Grok 4 की गणितीय क्षमताओं का मूल्यांकन करने के लिए नियुक्त किया, जिसने गुणात्मक जांच और बेंचमार्क डेटा के माध्यम से अन्य मॉडलों के सापेक्ष इसके मजबूत और कमजोर पहलुओं का वर्णन किया।
- Grok 4 मध्यम-कठिन उच्च विद्यालय गणित प्रतियोगिताओं को हल करने में अग्रणी है, समाधानों की गणना करके 85% के टाई (जो Gemini 2.5 Pro और o4-mini के बीच था) की तुलना में बेंचमार्क पर 88% स्कोर प्राप्त किया।
- मॉडल कठिन उच्च विद्यालय प्रतियोगिताओं से सिद्धांत-आधारित समस्याओं के लिए अग्रणी के करीब है, लेकिन सामान्य प्रमाणों में सुधार के लिए महत्वपूर्ण संभावनाएं दिखाता है।
- पेशेवर गणितज्ञों ने Grok 4 को गणितीय साहित्य खोज के लिए उपलब्ध सबसे अच्छे मॉडल के रूप में पहचाना।
- मूल्यांकन में नोट किया गया है कि Grok 4, अन्य LLMs की तरह, स्थानिक अंतर्ज्ञान या रचनात्मकता की तुलना में निम्न-स्तरीय गणना को प्राथमिकता देता है और अपने कुछ लेकिन सभी गलतियों को पकड़ने की प्रवृत्ति रखता है।
- Epoch AI ने xAI के रिलीज़ ब्लॉग का आलोचना की, विशेष रूप से भ्रामक प्रदर्शन चार्टों के लिए, यह नोट करते हुए कि हस्तक्षेप में ले जाने वाली प्रतियोगिताओं में Python उपकरणों का अनुचित समावेश था और आंतरिक USAMO ग्रेडिंग में पारदर्शिता की कमी थी।
यह विश्लेषण शीर्षक संख्याओं में प्रकट होने से पहले नवीन क्षमताओं के संकेतों की पहचान करने में मदद करता है और भविष्य के मॉडल विकास के लिए उपयोगी अतिरिक्त बेंचमार्क सुझाता है।