Un análisis comparativo evalúa las capacidades de Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 y Grok 3 Beta en benchmarks de matemáticas, programación y razonamiento.
- En GPQA Diamond, Grok 3 Beta alcanza el 84,6% con razonamiento extendido, mientras que Claude 3.7 Sonnet logra el 84,8% en el mismo modo.
- En las competiciones de matemáticas AIME, Grok 3 Beta lidera con un 93,3%, mientras que Claude 3.7 Sonnet obtiene un 61,3% pero destaca en Math500 con un 96,2%.
- OpenAI o3-mini demuestra un rendimiento sólido en AIME (hasta el 83,3%) y GPQA Diamond (78% en modo de mayor cómputo), con un enfoque en la rentabilidad.
- DeepSeek R1 tiene un desempeño competitivo en AIME (79,8%) pero muestra variabilidad en tareas de razonamiento a nivel de posgrado.
El estudio busca ayudar a los usuarios a tomar decisiones informadas al destacar los compromisos en costo, tamaño de la ventana de contexto y confiabilidad entre estos modelos líderes.