A Tencent tornou disponível como software de código aberto seu modelo base AuK 1.5B para geração e edição de fala, incluindo código e pesos do modelo.
- Suporta text-to-speech zero-shot e baseado em instruções, edição de conteúdo e acústica, edição paralinguística, aprimoramento de fala e separação de fontes por meio de uma interface unificada de linguagem natural.
- Inclui AuK-Flash, uma variante destilada em 4 etapas para inferência mais rápida.
- Utiliza o modelo Qwen2.5-Omni-3B como codificador MLLM.
- Lançado sob a Licença MIT com os pesos disponíveis no Hugging Face e ModelScope.
O lançamento permite que pesquisadores e desenvolvedores acessem o modelo base e as variantes destiladas para várias tarefas de processamento de áudio.