A xAI encomendou à Epoch AI a avaliação das habilidades matemáticas do Grok 4, caracterizando seus pontos fortes e fracos em relação a outros modelos por meio de investigação qualitativa e dados de benchmark.

  • O Grok 4 é o estado da arte na resolução de competições de matemática do ensino médio de dificuldade média-difícil, gerando soluções e obtendo 88% nos benchmarks, comparado ao empate anterior de 85% entre Gemini 2.5 Pro e o4-mini.
  • O modelo está próximo do estado da arte para problemas baseados em provas de competições desafiadoras do ensino médio, mas mostra uma margem significativa de melhoria em provas gerais.
  • Matemáticos profissionais identificaram o Grok 4 como potencialmente o melhor modelo disponível para busca na literatura matemática.
  • A avaliação observa que o Grok 4, como outros LLMs, favorece o cálculo de baixo nível em detrimento da intuição espacial ou criatividade e tende a capturar alguns, mas não todos, de seus próprios erros.
  • A Epoch AI criticou o blog de lançamento da xAI por gráficos de desempenho enganosos, notando especificamente a inclusão inadequada de ferramentas Python em competições destinadas a serem resolvidas à mão e a falta de transparência na avaliação interna do USAMO.

Esta análise ajuda a identificar sinais de capacidades novas antes que apareçam nos números principais e sugere benchmarks adicionais úteis para o desenvolvimento futuro de modelos.