xAI menugaskan Epoch AI untuk mengevaluasi kemampuan matematis Grok 4, dengan mengkarakterisasi kekuatan dan kelemahannya dibandingkan model lain melalui investigasi kualitatif dan data benchmark.

  • Grok 4 berada di tingkat state-of-the-art dalam menyelesaikan kompetisi matematika SMA tingkat menengah-sulit dengan cara menghitung solusi secara sistematis, meraih skor 88% pada benchmark dibandingkan sebelumnya yang seri 85% antara Gemini 2.5 Pro dan o4-mini.
  • Model ini mendekati state-of-the-art untuk masalah berbasis bukti dari kompetisi SMA yang menantang, namun menunjukkan ruang perbaikan yang signifikan dalam pembuktian umum.
  • Ahli matematika profesional mengidentifikasi Grok 4 sebagai model terbaik yang tersedia untuk pencarian literatur matematika.
  • Evaluasi mencatat bahwa Grok 4, seperti LLM lainnya, lebih menyukai perhitungan tingkat rendah daripada intuisi spasial atau kreativitas, dan cenderung menangkap sebagian tetapi tidak semua kesalahannya sendiri.
  • Epoch AI mengkritik blog rilis xAI karena grafik kinerja yang menyesatkan, khususnya dengan mencatat ketidaksesuaian penggunaan alat Python dalam kompetisi yang seharusnya diselesaikan secara manual serta kurangnya transparansi dalam penilaian USAMO internal.

Analisis ini membantu mengidentifikasi tanda-tanda kemampuan baru sebelum muncul dalam angka utama dan menyarankan benchmark tambahan yang berguna untuk pengembangan model di masa depan.