Tencent ha puesto a disposición como software de código abierto su modelo base AuK 1.5B para generación y edición de voz, incluyendo código y pesos del modelo.

  • Soporta text-to-speech zero-shot e instruido, edición de contenido y acústica, edición paralingüística, mejora de voz y separación de fuentes mediante una interfaz unificada de lenguaje natural.
  • Incluye AuK-Flash, una variante destilada en 4 pasos para inferencia más rápida.
  • Utiliza el modelo Qwen2.5-Omni-3B como codificador MLLM.
  • Publicado bajo la Licencia MIT con los pesos disponibles en Hugging Face y ModelScope.

El lanzamiento permite a investigadores y desarrolladores acceder al modelo base y a las variantes destiladas para diversas tareas de procesamiento de audio.