A Cartesia lançou o Sonic-3.6, a versão mais recente de seu modelo de texto para fala em tempo real, que agora ocupa a posição #1 em ambas as tabelas de fala do Artificial Analysis. A atualização foca na melhoria da naturalidade e utiliza modelos de espaço de estado em vez de transformers para alcançar latência de tempo até o primeiro áudio inferior a 90ms.
- O Sonic-3.6 pontua 1.283 Elo no quadro Provider Voice e 1.283 Elo no quadro Controlled Voice.
- O modelo está disponível em beta por meio da API hospedada da Cartesia, mas não oferece pesos para auto-hospedagem.
- Principais recursos de produção incluem tags de expressão inline, clonagem instantânea de voz a partir de 10 segundos de áudio e suporte nativo a caracteres alfanuméricos.
- O Artificial Analysis normaliza o preço em US$ 49,00 por 1M de caracteres, metade do custo do ElevenLabs Eleven v3.
O lançamento oferece uma solução TTS em streaming comercialmente implantável que equilibra baixa latência com alta naturalidade para aplicações como atendimento ao cliente e localização de mídia.