腾讯已将其用于语音生成和编辑的AuK 1.5B基础模型作为开源软件发布,包括代码和模型权重。
- 通过统一的自然语言接口,支持零样本和基于指令的文本转语音、内容与声学编辑、副语言编辑、语音增强以及声源分离。
- 包含AuK-Flash,一种用于更快推理的4步蒸馏变体。
- 使用Qwen2.5-Omni-3B模型作为其MLLM编码器。
- 根据MIT许可证发布,权重可在Hugging Face和ModelScope上获取。
此次发布使研究人员和开发人员能够访问基础模型和蒸馏变体,以用于各种音频处理任务。
腾讯已将其用于语音生成和编辑的AuK 1.5B基础模型作为开源软件发布,包括代码和模型权重。
此次发布使研究人员和开发人员能够访问基础模型和蒸馏变体,以用于各种音频处理任务。