Tencent a rendu disponible en tant que logiciel open-source son modèle de base AuK 1.5B pour la génération et l'édition de parole, incluant le code et les poids du modèle.
- Prend en charge la synthèse vocale zero-shot et basée sur des instructions, l'édition de contenu et acoustique, l'édition paralinguistique, l'amélioration de la parole et la séparation de sources via une interface unifiée en langage naturel.
- Inclut AuK-Flash, une variante distillée en 4 étapes pour une inférence plus rapide.
- Utilise le modèle Qwen2.5-Omni-3B comme encodeur MLLM.
- Publié sous la licence MIT avec les poids disponibles sur Hugging Face et ModelScope.
Cette publication permet aux chercheurs et développeurs d'accéder au modèle de base et aux variantes distillées pour diverses tâches de traitement audio.