Tencent a rendu le modèle fondamental AuK pour la génération et l'édition vocales disponible en open source, incluant le code et les poids sur Hugging Face et ModelScope. Le lancement comprend AuK-Flash, une variante distillée conçue pour une inférence rapide en seulement 4 étapes.
- AuK est un modèle de 1.5B entraîné sur des millions d'heures de données audio.
- Il prend en charge le TTS zero-shot, l'édition de contenu et acoustique, l'édition paralinguistique, l'amélioration vocale et la séparation de source via des instructions en langage naturel.
- Le dépôt fournit les poids officiels pour le modèle de base ainsi que pour la variante rapide AuK-Flash.
- Des exemples d'installation et d'utilisation sont fournis pour les plateformes Hugging Face et ModelScope.
Le lancement permet aux développeurs d'accéder à une interface unifiée pour plusieurs tâches vocales sous licence MIT.