腾讯已将用于语音生成和编辑的 AuK 基础模型开源,包括在 Hugging Face 和 ModelScope 上的代码和权重。此次发布包含 AuK-Flash,这是一种专为快速推理设计的蒸馏变体,仅需 4 步。
- AuK 是一个拥有 1.5B 参数的模型,在数百万小时的音频数据上训练而成。
- 它支持零样本 TTS、内容和声学编辑、副语言编辑、语音增强以及通过自然语言指令进行声源分离。
- 该仓库提供了基础模型和快速 AuK-Flash 变体的官方权重。
- 提供了适用于 Hugging Face 和 ModelScope 平台的安装和使用示例。
此次发布允许开发者通过 MIT 许可证访问用于多种语音任务的统一接口。