xAIは、Epoch AIにGrok 4の数学的能力を評価するよう委託し、定性的な調査とベンチマークデータを通じて、他のモデルとの比較でその強みと弱みを特徴づけた。
- Grok 4は、解法を地道に導き出すことで中堅以上の高校数学コンテストの問題を解決する点で最先端であり、ベンチマークで88%のスコアを記録した。これは、Gemini 2.5 Proとo4-miniが以前85%で並んでいたことと比較してである。
- このモデルは、難関な高校コンテストからの証明ベースの問題においてほぼ最先端だが、一般的な証明においては大幅に改善の余地があることが示された。
- プロの数学者たちは、Grok 4を数学文献検索において現在利用可能な最高のモデルとなる可能性があると特定した。
- 評価では、Grok 4が他の大規模言語モデルと同様に、空間的直感や創造性よりも低レベルの計算を好み、自身のミスの一部は捉えるもののすべてではないと指摘している。
- Epoch AIは、xAIのパフォーマンスチャートが誤解を招くものであるとしてリリースブログを批判し、手作業で行うべきコンテストにPythonツールを不適切に含めていること、および内部のUSAMO採点における透明性の欠如を特に指摘した。
この分析は、見出しの数値に現れる前に新たな能力の兆候を特定するのに役立ち、将来のモデル開発に有用な追加ベンチマークを示唆している。