FireRedTeam a publié deux nouveaux modèles audio open-source : FireRedAudio, un modèle de langage audio à usage général, et FireRedTTS3, un système unifié de génération et d'édition de parole.
- FireRedAudio est construit sur un LLM partagé de 9 milliards de paramètres avec des représentations continues découplées, prenant en charge la reconnaissance automatique de la parole (ASR), la compréhension audio, la synthèse vocale (TTS) zero-shot, le TTS instructif, l'édition sémantique/acoustique de la parole et l'ancrage temporel pour des enregistrements d'une durée maximale d'une heure.
- FireRedTTS3-Base permet le clonage vocal zero-shot dans 24 langues et 21 dialectes chinois, atteignant des résultats compétitifs sur les benchmarks MiniMax-MLS-Test et Seed-TTS-eval.
- FireRedTTS3-Instruct permet la conception de voix par langage naturel et l'édition de parole libre (sémantique et acoustique) au sein d'un seul modèle unifié.
Ces publications offrent aux utilisateurs des outils complets pour comprendre des contextes audio complexes et générer une parole multilingue de haute fidélité.