FireRedTeam发布了两个新的开源音频模型:FireRedAudio,一种通用音频语言模型;以及FireRedTTS3,一个统一的语音生成与编辑系统。

  • FireRedAudio基于共享的9B参数LLM构建,采用解耦的连续表示,支持ASR、音频理解、零样本TTS、指令式TTS、语义/声学语音编辑,以及对长达一小时录音的时间定位。
  • FireRedTTS3-Base支持跨24种语言和21种中文方言的零样本声音克隆,在MiniMax-MLS-Test和Seed-TTS-eval基准测试中取得了具有竞争力的结果。
  • FireRedTTS3-Instruct允许在单一统一模型中进行自然语言语音设计和自由形式的语音编辑(语义和声学)。

这些发布为用户提供了全面的工具,用于理解复杂的音频上下文并生成高保真、多语言的语音。