Tencent a rendu le modèle fondamental AuK pour la génération et l'édition vocales disponible en open source, incluant le code et les poids sur Hugging Face et ModelScope. Le lancement comprend AuK-Flash, une variante distillée conçue pour une inférence rapide en seulement 4 étapes.

  • AuK est un modèle de 1.5B entraîné sur des millions d'heures de données audio.
  • Il prend en charge le TTS zero-shot, l'édition de contenu et acoustique, l'édition paralinguistique, l'amélioration vocale et la séparation de source via des instructions en langage naturel.
  • Le dépôt fournit les poids officiels pour le modèle de base ainsi que pour la variante rapide AuK-Flash.
  • Des exemples d'installation et d'utilisation sont fournis pour les plateformes Hugging Face et ModelScope.

Le lancement permet aux développeurs d'accéder à une interface unifiée pour plusieurs tâches vocales sous licence MIT.