Le laboratoire Tongyi d'Alibaba a publié Qwen-Audio-3.0-TTS, un système de synthèse vocale hébergé disponible en deux variantes : Flash pour l'interaction en temps réel et Plus pour une génération de haute qualité. Les deux versions sont proposées via Alibaba Cloud Model Studio plutôt que sous forme de poids téléchargeables.
- Le modèle prend en charge 16 langues et 20 régions dialectales chinoises, avec Flash atteignant le taux d'erreur moyen le plus bas sur les mots/caractères à 3,87.
- Qwen-Audio-3.0-TTS-Plus se classe premier au classement Text-to-Speech d'Artificial Analysis avec un score Elo proche de 1 236.
- Le système inclut 86 balises intégrées fines pour les détails non verbaux comme le rire et la respiration, ainsi qu'un contrôle du style en langage naturel.
- Flash vise une latence du premier paquet de 300 ms, tandis que Plus se concentre sur la fidélité timbrale et la similarité des locuteurs, se classant premier dans toutes les 16 langues.
Cette publication offre aux développeurs des capacités robustes de synthèse multilingue et un contrôle audio fin via une API hébergée.