Anthropic a publié un complément à la fiche modèle de Claude 3 détaillant Claude 3.5 Sonnet, un nouveau modèle qui surpasse Claude 3 Opus en vitesse et en coût tout en offrant des capacités améliorées en codage et en traitement visuel.
- Claude 3.5 Sonnet établit de nouveaux standards de performance sur la science de niveau supérieur (GPQA), le raisonnement général (MMLU) et la maîtrise du codage (HumanEval).
- Il obtient des résultats de pointe sur cinq benchmarks de vision, dont MathVista, ChartQA et DocVQA.
- Dans une évaluation interne de codage agentic, le modèle résout 64 % des problèmes contre 38 % pour Claude 3 Opus.
- Les évaluations par retour humain montrent des taux de victoire significatifs face à Claude 3 Opus sur les capacités clés comme le codage, les documents et l'écriture créative.
- Le complément signale également des taux de refus améliorés sur les ensembles de données Wildchat et XSTest et une mémorisation quasi parfaite aux tests Needle In A Haystack jusqu'à 200k tokens.