AuK技术报告介绍了一个开源基础模型,该模型通过自然语言指令和音频上下文统一了语音生成和编辑。
- 该模型在五个任务家族上使用了约30.3亿条指令-音频实例和195万小时的监督数据进行训练。
- 架构结合了多模态大语言模型、用于声学条件的VAE以及混合整流流Transformer。
- 后训练包括人类反馈偏好优化和基于奖励的强化学习。
- AuK-Flash实现了4步推理,相比完整模型在墙钟时间上加速了4.5倍。
作者发布了源代码和模型权重,以支持可重复性和进一步的研究。
AuK技术报告介绍了一个开源基础模型,该模型通过自然语言指令和音频上下文统一了语音生成和编辑。
作者发布了源代码和模型权重,以支持可重复性和进一步的研究。