O Laboratório Tongyi da Alibaba lançou o Qwen-Audio-3.0-TTS, um sistema de texto para fala hospedado disponível em duas variantes: Flash para interação em tempo real e Plus para geração de alta qualidade. Ambos os níveis são fornecidos por meio do Alibaba Cloud Model Studio, e não como pesos baixáveis.
- O modelo suporta 16 idiomas e 20 regiões de dialetos chineses, com o Flash alcançando a menor taxa média de erro de palavra/caractere em 3,87.
- Qwen-Audio-3.0-TTS-Plus ocupa o primeiro lugar no ranking de texto para fala da Artificial Analysis com um Elo próximo a 1.236.
- O sistema inclui 86 tags inline finas para detalhes não verbais como risadas e respiração, juntamente com controle de estilo em linguagem natural.
- O Flash tem como alvo uma latência do primeiro pacote de 300 ms, enquanto o Plus foca na fidelidade timbral e similaridade do locutor, classificando-se no topo em todos os 16 idiomas.
O lançamento oferece aos desenvolvedores capacidades robustas de síntese multilíngue e controle de áudio fino por meio de uma API hospedada.