Сравнительный анализ оценивает возможности Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 и Grok 3 Beta в задачах математики, программирования и рассуждений по результатам бенчмарков.
- На GPQA Diamond Grok 3 Beta достигает 84,6% при расширенном рассуждении, тогда как Claude 3.7 Sonnet показывает 84,8% в том же режиме.
- В математических соревнованиях AIME Grok 3 Beta лидирует с результатом 93,3%, тогда как Claude 3.7 Sonnet набирает 61,3%, но демонстрирует превосходство на Math500 с результатом 96,2%.
- OpenAI o3-mini показывает высокую эффективность на AIME (до 83,3%) и GPQA Diamond (78% в режиме с повышенными вычислительными ресурсами), делая акцент на экономическую эффективность.
- DeepSeek R1 конкурентоспособен на AIME (79,8%), но демонстрирует нестабильность на задачах рассуждения университетского уровня.
Исследование направлено на помощь пользователям в принятии обоснованных решений за счет выделения компромиссов в стоимости, размере контекстного окна и надежности этих ведущих моделей.