FireRedTeam telah merilis dua model audio sumber terbuka baru: FireRedAudio, sebuah model bahasa audio serbaguna, dan FireRedTTS3, sebuah sistem terpadu untuk generasi dan pengeditan suara.
- FireRedAudio dibangun di atas LLM 9B-parameter yang berbagi representasi kontinu terdekoupling, mendukung ASR, pemahaman audio, TTS zero-shot, TTS instruksi, pengeditan ucapan semantik/akustik, dan penjangkaran temporal untuk rekaman hingga satu jam.
- FireRedTTS3-Base memungkinkan kloning suara zero-shot di 24 bahasa dan 21 dialek Mandarin, mencapai hasil kompetitif pada benchmark MiniMax-MLS-Test dan Seed-TTS-eval.
- FireRedTTS3-Instruct memungkinkan desain suara berbasis bahasa alami dan pengeditan ucapan bebas bentuk (semantik dan akustik) dalam satu model terpadu.
Rilis ini menyediakan pengguna dengan alat komprehensif untuk memahami konteks audio kompleks serta menghasilkan ucapan multibahasa berfidelitas tinggi.