A FireRedTeam lançou dois novos modelos de áudio de código aberto: o FireRedAudio, um modelo de linguagem de áudio de propósito geral, e o FireRedTTS3, um sistema unificado de geração e edição de fala.

  • O FireRedAudio é construído sobre um LLM compartilhado de 9B parâmetros com representações contínuas desacopladas, suportando ASR, compreensão de áudio, TTS zero-shot, TTS instrucional, edição semântica/acústica de fala e ancoragem temporal para gravações de até uma hora.
  • O FireRedTTS3-Base permite clonagem de voz zero-shot em 24 idiomas e 21 dialetos chineses, alcançando resultados competitivos nos benchmarks MiniMax-MLS-Test e Seed-TTS-eval.
  • O FireRedTTS3-Instruct permite o design de voz por linguagem natural e a edição de fala livre-forma (semântica e acústica) dentro de um único modelo unificado.

Esses lançamentos fornecem aos usuários ferramentas abrangentes tanto para compreender contextos de áudio complexos quanto para gerar fala multilíngue de alta fidelidade.