Tencent telah membuat model dasar AuK untuk generasi dan pengeditan suara tersedia sebagai sumber terbuka, termasuk kode dan bobot di Hugging Face dan ModelScope. Rilis ini mencakup AuK-Flash, varian distilasi yang dirancang untuk inferensi cepat dengan hanya 4 langkah.
- AuK adalah model 1.5B yang dilatih pada jutaan jam data audio.
- Mendukung TTS zero-shot, pengeditan konten dan akustik, pengeditan paralinguistik, peningkatan suara, dan pemisahan sumber melalui instruksi bahasa alami.
- Repositori menyediakan bobot resmi untuk model dasar maupun varian cepat AuK-Flash.
- Contoh instalasi dan penggunaan disediakan untuk platform Hugging Face dan ModelScope.
Rilis ini memungkinkan pengembang mengakses antarmuka terpadu untuk berbagai tugas suara melalui lisensi MIT.