Une analyse comparative évalue les capacités de Claude 3.7 Sonnet, Claude 3.5 Sonnet, OpenAI o3-mini, DeepSeek R1 et Grok 3 Beta sur des benchmarks de mathématiques, de codage et de raisonnement.

  • Sur GPQA Diamond, Grok 3 Beta atteint 84,6 % avec un raisonnement étendu, tandis que Claude 3.7 Sonnet obtient 84,8 % dans le même mode.
  • Dans les compétitions de mathématiques AIME, Grok 3 Beta mène avec 93,3 %, alors que Claude 3.7 Sonnet marque 61,3 % mais excelle sur Math500 à 96,2 %.
  • OpenAI o3-mini démontre de solides performances sur AIME (jusqu'à 83,3 %) et GPQA Diamond (78 % en mode à calcul accru) avec un accent mis sur le rapport coût-efficacité.
  • DeepSeek R1 est compétitif sur AIME (79,8 %) mais montre une variabilité sur les tâches de raisonnement de niveau graduate.

L'étude vise à aider les utilisateurs à prendre des décisions éclairées en mettant en évidence les compromis entre coût, taille de la fenêtre contextuelle et fiabilité parmi ces modèles de pointe.