Tencent ha hecho disponible el modelo base AuK para la generación y edición de voz como código abierto, incluyendo el código y los pesos en Hugging Face y ModelScope. El lanzamiento incluye AuK-Flash, una variante destilada diseñada para una inferencia rápida con solo 4 pasos.
- AuK es un modelo de 1.5B entrenado con millones de horas de datos de audio.
- Soporta TTS zero-shot, edición de contenido y acústica, edición paralingüística, mejora de voz y separación de fuentes mediante instrucciones en lenguaje natural.
- El repositorio proporciona pesos oficiales tanto para el modelo base como para la variante rápida AuK-Flash.
- Se proporcionan ejemplos de instalación y uso para las plataformas Hugging Face y ModelScope.
El lanzamiento permite a los desarrolladores acceder a una interfaz unificada para múltiples tareas de voz bajo la licencia MIT.