Tencent ha puesto a disposición como software de código abierto su modelo base AuK 1.5B para generación y edición de voz, incluyendo código y pesos del modelo.
- Soporta text-to-speech zero-shot e instruido, edición de contenido y acústica, edición paralingüística, mejora de voz y separación de fuentes mediante una interfaz unificada de lenguaje natural.
- Incluye AuK-Flash, una variante destilada en 4 pasos para inferencia más rápida.
- Utiliza el modelo Qwen2.5-Omni-3B como codificador MLLM.
- Publicado bajo la Licencia MIT con los pesos disponibles en Hugging Face y ModelScope.
El lanzamiento permite a investigadores y desarrolladores acceder al modelo base y a las variantes destiladas para diversas tareas de procesamiento de audio.