Tencent ha hecho disponible el modelo base AuK para la generación y edición de voz como código abierto, incluyendo el código y los pesos en Hugging Face y ModelScope. El lanzamiento incluye AuK-Flash, una variante destilada diseñada para una inferencia rápida con solo 4 pasos.

  • AuK es un modelo de 1.5B entrenado con millones de horas de datos de audio.
  • Soporta TTS zero-shot, edición de contenido y acústica, edición paralingüística, mejora de voz y separación de fuentes mediante instrucciones en lenguaje natural.
  • El repositorio proporciona pesos oficiales tanto para el modelo base como para la variante rápida AuK-Flash.
  • Se proporcionan ejemplos de instalación y uso para las plataformas Hugging Face y ModelScope.

El lanzamiento permite a los desarrolladores acceder a una interfaz unificada para múltiples tareas de voz bajo la licencia MIT.