xAI a commandé à Epoch AI d'évaluer les capacités mathématiques de Grok 4, en caractérisant ses forces et ses faiblesses par rapport aux autres modèles grâce à une enquête qualitative et des données de benchmark.

  • Grok 4 est à la pointe de la technologie pour résoudre des compétitions de mathématiques de lycée de difficulté moyenne à élevée en produisant des solutions pas à pas, obtenant 88 % aux benchmarks contre un ex æquo précédent de 85 % entre Gemini 2.5 Pro et o4-mini.
  • Le modèle est proche de l'état de l'art pour les problèmes basés sur la démonstration issus de compétitions de lycée exigeantes, mais montre une marge de progression significative pour les démonstrations générales.
  • Des mathématiciens professionnels ont identifié Grok 4 comme potentiellement le meilleur modèle disponible pour la recherche dans la littérature mathématique.
  • L'évaluation note que Grok 4, comme d'autres LLM, privilégie le calcul de bas niveau par rapport à l'intuition spatiale ou à la créativité et a tendance à détecter certaines mais pas toutes ses propres erreurs.
  • Epoch AI a critiqué le blog de publication de xAI pour des graphiques de performances trompeurs, notant spécifiquement l'inclusion inappropriée d'outils Python dans des compétitions censées être réalisées à la main et un manque de transparence dans la notation interne de l'USAMO.

Cette analyse aide à identifier les signes de capacités novatrices avant qu'elles n'apparaissent dans les chiffres en une et suggère des benchmarks supplémentaires utiles pour le développement futur des modèles.