كلفت xAI Epoch AI بتقييم القدرات الرياضية لـ Grok 4، من خلال تحديد نقاط القوة والضعف مقارنةً بالنماذج الأخرى عبر تحقيق نوعي وبيانات المعايير.
- يُعد Grok 4 الأفضل في حل مسابقات رياضيات المرحلة الثانوية متوسطة الصعوبة عن طريق استخلاص الحلول، حيث حقق 88% على معايير التقييم مقارنةً بالتعادل السابق بنسبة 85% بين Gemini 2.5 Pro و o4-mini.
- النموذج قريب من الحالة المتقدمة في المشكلات القائمة على البراهين من مسابقات المرحلة الثانوية الصعبة، لكنه يظهر مجالاً كبيراً للتحسين في البراهين العامة.
- حدد علماء الرياضيات المحترفون Grok 4 كنموذج متاح محتمل الأفضل للبحث في الأدبيات الرياضية.
- تلاحظ التقييمات أن Grok 4، مثل نماذج اللغة الكبيرة الأخرى، يفضل الحسابات منخفضة المستوى على الحدس المكاني أو الإبداع، ويميل إلى اكتشاف بعض أخطائه وليس كلها.
- انتقدت Epoch AI مدونة إطلاق xAI لرسوم الأداء المضللة، مشيرةً تحديداً إلى الإدراج غير المناسب لأدوات Python في مسابقات يُفترض حلها يدوياً، ونقص الشفافية في تقييم USAMO الداخلي.
يساعد هذا التحليل في تحديد علامات القدرات الجديدة قبل ظهورها في الأرقام الرئيسية ويقترح معايير إضافية مفيدة لتطوير النماذج المستقبلية.