FireRedTeam выпустила две новые модели с открытым исходным кодом для работы с аудио: FireRedAudio — универсальную языковую модель для аудио, и FireRedTTS3 — единую систему генерации и редактирования речи.

  • FireRedAudio построена на общей LLM с 9 млрд параметров с разделёнными непрерывными представлениями, поддерживает ASR, понимание аудио, zero-shot TTS, instruct TTS, семантическое/акустическое редактирование речи и временное выравнивание для записей длительностью до одного часа.
  • FireRedTTS3-Base обеспечивает клонирование голоса в режиме zero-shot на 24 языках и 21 китайском диалекте, показывая конкурентоспособные результаты на бенчмарках MiniMax-MLS-Test и Seed-TTS-eval.
  • FireRedTTS3-Instruct позволяет создавать голос с помощью естественного языка и выполнять редактирование речи произвольной формы (семантическое и акустическое) в рамках единой модели.

Эти выпуски предоставляют пользователям комплексные инструменты как для понимания сложных аудио контекстов, так и для генерации высококачественной многоязычной речи.