A xAI encomendou à Epoch AI a avaliação das habilidades matemáticas do Grok 4, caracterizando seus pontos fortes e fracos em relação a outros modelos por meio de investigação qualitativa e dados de benchmark.
- O Grok 4 é o estado da arte na resolução de competições de matemática do ensino médio de dificuldade média-difícil, gerando soluções e obtendo 88% nos benchmarks, comparado ao empate anterior de 85% entre Gemini 2.5 Pro e o4-mini.
- O modelo está próximo do estado da arte para problemas baseados em provas de competições desafiadoras do ensino médio, mas mostra uma margem significativa de melhoria em provas gerais.
- Matemáticos profissionais identificaram o Grok 4 como potencialmente o melhor modelo disponível para busca na literatura matemática.
- A avaliação observa que o Grok 4, como outros LLMs, favorece o cálculo de baixo nível em detrimento da intuição espacial ou criatividade e tende a capturar alguns, mas não todos, de seus próprios erros.
- A Epoch AI criticou o blog de lançamento da xAI por gráficos de desempenho enganosos, notando especificamente a inclusão inadequada de ferramentas Python em competições destinadas a serem resolvidas à mão e a falta de transparência na avaliação interna do USAMO.
Esta análise ajuda a identificar sinais de capacidades novas antes que apareçam nos números principais e sugere benchmarks adicionais úteis para o desenvolvimento futuro de modelos.