xAI는 Epoch AI에 Grok 4의 수학 능력을 평가하도록 의뢰했으며, 정성적 조사와 벤치마크 데이터를 통해 다른 모델 대비 강점과 약점을 특성화했습니다.

  • Grok 4는 중상급 고등학교 수학 경시대회 문제를 풀이 과정을 통해 해결하는 데 최첨단 수준으로, 벤치마크에서 88%의 점수를 기록했으며 이는 이전의 Gemini 2.5 Pro와 o4-mini 간 85% 동점보다 높은 수치입니다.
  • 이 모델은 어려운 고등학교 경시대회에서 증명 기반 문제에 대해 거의 최첨단 수준이지만, 일반 증명 영역에서는 개선 여지가 큽니다.
  • 전문 수학자들은 Grok 4를 수학 문헌 검색에 있어 잠재적으로 가장 우수한 모델로 평가했습니다.
  • 평가 결과, Grok 4는 다른 대규모 언어 모델(LLM)과 마찬가지로 공간적 직관이나 창의성보다 저수준 계산을 선호하며, 자신의 실수를 일부는 잡아내지만 모두는 놓치는 경향이 있음을 지적했습니다.
  • Epoch AI는 xAI의 출시 블로그가 오해의 소지가 있는 성능 차트를 사용했다고 비판했으며, 특히 손으로 풀어야 하는 경시대회에 Python 도구를 부적절하게 포함했고 내부 USAMO 채점의 투명성이 부족하다고 명시했습니다.

이 분석은 헤드라인 수치에 나타나기 전에 새로운 능력의 징후를 식별하는 데 도움이 되며, 향후 모델 개발에 유용한 추가 벤치마크를 제안합니다.