Uma análise comparativa avalia as capacidades do Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 e Grok 3 Beta em benchmarks de matemática, programação e raciocínio.
- No GPQA Diamond, o Grok 3 Beta atinge 84,6% com raciocínio estendido, enquanto o Claude 3.7 Sonnet alcança 84,8% no mesmo modo.
- Nas competições de matemática AIME, o Grok 3 Beta lidera com 93,3%, enquanto o Claude 3.7 Sonnet obtém 61,3%, mas se destaca no Math500 com 96,2%.
- O OpenAI o3-mini demonstra desempenho sólido no AIME (até 83,3%) e no GPQA Diamond (78% no modo de maior consumo computacional), com foco na relação custo-benefício.
- O DeepSeek R1 tem desempenho competitivo no AIME (79,8%), mas apresenta variabilidade em tarefas de raciocínio de nível de pós-graduação.
O estudo visa ajudar os usuários a tomar decisões informadas, destacando as compensações entre custo, tamanho da janela de contexto e confiabilidade nesses modelos de ponta.