xAI encargó a Epoch AI evaluar las habilidades matemáticas de Grok 4, caracterizando sus fortalezas y debilidades en comparación con otros modelos mediante investigación cualitativa y datos de benchmarks.

  • Grok 4 es el estado del arte para resolver competiciones de matemáticas de nivel medio-alto de secundaria mediante la resolución paso a paso, obteniendo un 88% en los benchmarks en comparación con el empate previo del 85% entre Gemini 2.5 Pro y o4-mini.
  • El modelo está cerca del estado del arte para problemas basados en demostraciones de competiciones exigentes de secundaria, pero muestra un margen significativo de mejora en demostraciones generales.
  • Matemáticos profesionales identificaron a Grok 4 como potencialmente el mejor modelo disponible para la búsqueda en literatura matemática.
  • La evaluación señala que Grok 4, al igual que otros LLMs, favorece el cálculo de bajo nivel sobre la intuición espacial o la creatividad y tiende a detectar algunos pero no todos sus propios errores.
  • Epoch AI criticó el blog de lanzamiento de xAI por gráficos de rendimiento engañosos, señalando específicamente la inclusión inapropiada de herramientas de Python en competiciones que debían resolverse manualmente y la falta de transparencia en la calificación interna del USAMO.

Este análisis ayuda a identificar señales de capacidades novedosas antes de que aparezcan en las cifras principales y sugiere benchmarks adicionales útiles para el desarrollo futuro de modelos.