Lab Tongyi Alibaba telah merilis Qwen-Audio-3.0-TTS, sebuah sistem text-to-speech yang di-hosting dan tersedia dalam dua varian: Flash untuk interaksi real-time dan Plus untuk generasi berkualitas tinggi. Kedua tier disediakan melalui Alibaba Cloud Model Studio, bukan sebagai bobot yang dapat diunduh.

  • Model ini mendukung 16 bahasa dan 20 wilayah dialek Mandarin, dengan Flash mencapai tingkat kesalahan kata/karakter rata-rata terendah sebesar 3.87.
  • Qwen-Audio-3.0-TTS-Plus menduduki peringkat pertama di papan peringkat Artificial Analysis Text-to-Speech dengan skor Elo mendekati 1.236.
  • Sistem ini mencakup 86 tag inline yang sangat rinci untuk detail non-verbal seperti tawa dan napas, bersama dengan kontrol gaya berbasis bahasa alami.
  • Flash menargetkan latensi paket pertama sebesar 300 ms, sementara Plus berfokus pada kesetiaan timbre dan kemiripan pembicara, menduduki peringkat teratas di seluruh 16 bahasa.

Rilis ini menyediakan kepada pengembang kemampuan sintesis multibahasa yang kuat serta kontrol audio yang sangat rinci melalui API yang di-hosting.