FireRedTeamは、2つの新しいオープンソース音声モデルをリリースしました。1つは汎用音声言語モデルであるFireRedAudio、もう1つは統合された音声生成および編集システムであるFireRedTTS3です。

  • FireRedAudioは、結合された連続表現を持つ共有9BパラメータのLLMを基盤としており、ASR、音声理解、ゼロショットTTS、インストラクション付きTTS、意味的/音響的な音声編集、および最大1時間の録音に対する時間的グラウンディングをサポートします。
  • FireRedTTS3-Baseは、24言語と21の中国語方言にわたってゼロショットボイスクローニングを可能にし、MiniMax-MLS-TestおよびSeed-TTS-evalベンチマークで競争力のある結果を達成しました。
  • FireRedTTS3-Instructは、単一の統合モデル内で自然言語による音声設計と自由形式の音声編集(意味的および音響的)を可能にします。

これらのリリースにより、ユーザーは複雑な音声コンテキストの理解と高忠実度・多言語の音声生成の両方に対して包括的なツールを利用できるようになります。