Anthropic a publié Claude 3.7 Sonnet, un modèle conçu pour des cas d'utilisation professionnels et développeurs réels plutôt que pour l'optimisation de benchmarks. La publication introduit la possibilité de basculer dynamiquement entre les modes de raisonnement standard et avancé, permettant aux utilisateurs de contrôler le nombre de tokens alloués au « temps de réflexion ».

  • Le prix est fixé à 3 $/M tokens d'entrée et 15 $/M tokens de sortie, le positionnant entre o1 d'OpenAI et DeepSeek R1.
  • Le modèle présente une architecture hybride offrant une latence d'environ 200 ms en mode standard et jusqu'à 15 secondes en mode de réflexion étendu.
  • Les benchmarks montrent de solides performances en raisonnement de niveau master (GPQA Diamond : 78,2 % / 84,8 %) et en codage (SWE-bench : 62,3 % / 70,3 %), bien qu'il éprouve des difficultés avec les scores aux compétitions de mathématiques de lycée.
  • Des évaluations indépendantes indiquent qu'aucun des modèles testés, y compris Claude 3.7 Sonnet, ne sont fiables pour les problèmes de mathématiques complexes, tous obtenant des scores équivalents à un lancer de pièce sur des questions de type SAT.

Le contrôle configurable de la latence et du budget de tokens offre aux développeurs la flexibilité d'équilibrer vitesse et précision sans avoir besoin de modèles séparés pour différentes tâches.