El laboratorio Tongyi de Alibaba ha lanzado Qwen-Audio-3.0-TTS, un sistema de texto a voz alojado disponible en dos variantes: Flash para interacción en tiempo real y Plus para generación de alta calidad. Ambas versiones se entregan a través de Alibaba Cloud Model Studio en lugar de como pesos descargables.
- El modelo admite 16 idiomas y 20 regiones dialectales chinas, con Flash logrando la tasa de error promedio más baja por palabra/carácter de 3.87.
- Qwen-Audio-3.0-TTS-Plus ocupa el primer lugar en el tablero de clasificación de texto a voz de Artificial Analysis con una puntuación Elo cercana a 1.236.
- El sistema incluye 86 etiquetas en línea finamente granulares para detalles no verbales como risas y respiración, junto con control de estilo mediante lenguaje natural.
- Flash apunta a una latencia del primer paquete de 300 ms, mientras que Plus se centra en la fidelidad del timbre y la similitud del hablante, ocupando el primer lugar en los 16 idiomas.
El lanzamiento proporciona a los desarrolladores capacidades robustas de síntesis multilingüe y control de audio fino a través de una API alojada.