A Anthropic publicou um adendo ao Cartão do Modelo Claude, detalhando o Claude 3.5 Sonnet, um novo modelo que supera o Claude 3 Opus em velocidade e custo, ao mesmo tempo que oferece capacidades aprimoradas em codificação e processamento visual.
- O Claude 3.5 Sonnet estabelece novos padrões de desempenho em ciência de nível de pós-graduação (GPQA), raciocínio geral (MMLU) e proficiência em codificação (HumanEval).
- Ele alcança resultados de ponta em cinco benchmarks de visão, incluindo MathVista, ChartQA e DocVQA.
- Em uma avaliação interna de codificação agêntica, o modelo resolve 64% dos problemas, comparado a 38% para o Claude 3 Opus.
- Avaliações com feedback humano mostram taxas de vitória significativas sobre o Claude 3 Opus em capacidades principais como codificação, documentos e escrita criativa.
- O adendo também relata taxas de recusa aprimoradas nos conjuntos de dados Wildchat e XSTest e recall quase perfeito em testes Needle In A Haystack até 200k tokens.