A Tencent tornou disponível como software de código aberto seu modelo base AuK 1.5B para geração e edição de fala, incluindo código e pesos do modelo.

  • Suporta text-to-speech zero-shot e baseado em instruções, edição de conteúdo e acústica, edição paralinguística, aprimoramento de fala e separação de fontes por meio de uma interface unificada de linguagem natural.
  • Inclui AuK-Flash, uma variante destilada em 4 etapas para inferência mais rápida.
  • Utiliza o modelo Qwen2.5-Omni-3B como codificador MLLM.
  • Lançado sob a Licença MIT com os pesos disponíveis no Hugging Face e ModelScope.

O lançamento permite que pesquisadores e desenvolvedores acessem o modelo base e as variantes destiladas para várias tarefas de processamento de áudio.