A Tencent disponibilizou o modelo base AuK para geração e edição de fala como código aberto, incluindo código e pesos no Hugging Face e ModelScope. O lançamento inclui o AuK-Flash, uma variante destilada projetada para inferência rápida com apenas 4 etapas.

  • O AuK é um modelo de 1.5B treinado em milhões de horas de dados de áudio.
  • Suporta TTS zero-shot, edição de conteúdo e acústica, edição paralinguística, aprimoramento de fala e separação de fontes por meio de instruções em linguagem natural.
  • O repositório fornece pesos oficiais tanto para o modelo base quanto para a variante rápida AuK-Flash.
  • São fornecidos exemplos de instalação e uso para as plataformas Hugging Face e ModelScope.

O lançamento permite que desenvolvedores acessem uma interface unificada para múltiplas tarefas de fala sob a licença MIT.