xAI заказала Epoch AI оценку математических способностей Grok 4, охарактеризовав её сильные и слабые стороны по сравнению с другими моделями посредством качественного анализа и данных бенчмарков.
- Grok 4 демонстрирует передовые результаты в решении задач средней сложности из школьных математических олимпиад методом последовательного вычисления решений, набирая 88% на бенчмарках по сравнению с предыдущим результатом 85%, который был у Gemini 2.5 Pro и o4-mini.
- Модель близка к передовому уровню в решении задач, требующих доказательств, из сложных школьных олимпиад, но показывает значительный потенциал для улучшения в области общих доказательств.
- Профессиональные математики определили Grok 4 как потенциально лучшую доступную модель для поиска по математической литературе.
- В оценке отмечается, что Grok 4, как и другие LLM, отдаёт предпочтение низкоуровневым вычислениям над пространственным интуитивным мышлением или креативностью и склонна замечать некоторые, но не все свои ошибки.
- Epoch AI раскритиковала блог xAI о выпуске за введение в заблуждение графиками производительности, отметив неуместное включение инструментов Python в соревнования, предназначенные для решения вручную, и отсутствие прозрачности во внутренней оценке USAMO.
Этот анализ помогает выявлять признаки новых возможностей до их появления в основных показателях и предлагает дополнительные бенчмарки, полезные для разработки будущих моделей.