Tencent telah membuat model dasar AuK 1.5B-nya untuk generasi dan pengeditan suara tersedia sebagai perangkat lunak open-source, termasuk kode dan bobot model.
- Mendukung text-to-speech zero-shot dan berbasis instruksi, pengeditan konten dan akustik, pengeditan paralinguistik, peningkatan suara, dan pemisahan sumber melalui antarmuka bahasa alami yang terpadu.
- Termasuk AuK-Flash, varian distilasi 4 langkah untuk inferensi yang lebih cepat.
- Menggunakan model Qwen2.5-Omni-3B sebagai encoder MLLM-nya.
- Dirilis di bawah Lisensi MIT dengan bobot tersedia di Hugging Face dan ModelScope.
Rilis ini memungkinkan peneliti dan pengembang mengakses model dasar dan varian distilasi untuk berbagai tugas pemrosesan audio.