Tencent telah membuat model dasar AuK untuk generasi dan pengeditan suara tersedia sebagai sumber terbuka, termasuk kode dan bobot di Hugging Face dan ModelScope. Rilis ini mencakup AuK-Flash, varian distilasi yang dirancang untuk inferensi cepat dengan hanya 4 langkah.

  • AuK adalah model 1.5B yang dilatih pada jutaan jam data audio.
  • Mendukung TTS zero-shot, pengeditan konten dan akustik, pengeditan paralinguistik, peningkatan suara, dan pemisahan sumber melalui instruksi bahasa alami.
  • Repositori menyediakan bobot resmi untuk model dasar maupun varian cepat AuK-Flash.
  • Contoh instalasi dan penggunaan disediakan untuk platform Hugging Face dan ModelScope.

Rilis ini memungkinkan pengembang mengakses antarmuka terpadu untuk berbagai tugas suara melalui lisensi MIT.