A Anthropic lançou o Claude 3.7 Sonnet, um modelo projetado para casos de uso reais de negócios e desenvolvedores, em vez de apenas otimização de benchmarks. O lançamento introduz a capacidade de alternar dinamicamente entre os modos de raciocínio padrão e avançado, permitindo que os usuários controlem o número de tokens alocados ao "tempo de pensamento".
- O preço está definido em $3/M tokens de entrada e $15/M tokens de saída, posicionando-o entre o o1 da OpenAI e o DeepSeek R1.
- O modelo apresenta uma arquitetura híbrida que oferece latência de ~200 ms no modo padrão e até 15 segundos no modo de pensamento estendido.
- Os benchmarks mostram forte desempenho em raciocínio de nível de pós-graduação (GPQA Diamond: 78,2% / 84,8%) e programação (SWE-bench: 62,3% / 70,3%), embora tenha dificuldades com pontuações de competições de matemática do ensino médio.
- Avaliações independentes indicam que nenhum dos modelos testados, incluindo o Claude 3.7 Sonnet, é confiável para problemas complexos de matemática, com todos obtendo níveis próximos ao acaso em questões estilo SAT.
O controle configurável de latência e orçamento de tokens fornece aos desenvolvedores flexibilidade para equilibrar velocidade e precisão sem precisar de modelos separados para diferentes tarefas.