A Anthropic publicou um adendo ao Cartão do Modelo Claude, detalhando o Claude 3.5 Sonnet, um novo modelo que supera o Claude 3 Opus em velocidade e custo, ao mesmo tempo que oferece capacidades aprimoradas em codificação e processamento visual.

  • O Claude 3.5 Sonnet estabelece novos padrões de desempenho em ciência de nível de pós-graduação (GPQA), raciocínio geral (MMLU) e proficiência em codificação (HumanEval).
  • Ele alcança resultados de ponta em cinco benchmarks de visão, incluindo MathVista, ChartQA e DocVQA.
  • Em uma avaliação interna de codificação agêntica, o modelo resolve 64% dos problemas, comparado a 38% para o Claude 3 Opus.
  • Avaliações com feedback humano mostram taxas de vitória significativas sobre o Claude 3 Opus em capacidades principais como codificação, documentos e escrita criativa.
  • O adendo também relata taxas de recusa aprimoradas nos conjuntos de dados Wildchat e XSTest e recall quase perfeito em testes Needle In A Haystack até 200k tokens.