FireRedTeam ने दो नए ओपन-सोर्स ऑडियो मॉडल जारी किए हैं: FireRedAudio, एक सामान्य उद्देश्य वाला ऑडियो भाषा मॉडल, और FireRedTTS3, एक एकीकृत वक्ता उत्पादन और संपादन प्रणाली।
- FireRedAudio एक साझा 9B-पैरामीटर LLM पर बनाया गया है जिसमें अलग किए गए निरंतर प्रतिनिधित्व हैं, जो ASR, ऑडियो समझ, ज़ीरो-शॉट TTS, निर्देश TTS, अर्थपूर्ण/ध्वनिक वक्ता संपादन और एक घंटे तक के रिकॉर्डिंग्स के लिए समयबद्ध स्थानीकरण का समर्थन करता है।
- FireRedTTS3-Base 24 भाषाओं और 21 चीनी बोलियों में ज़ीरो-शॉट वक्ता क्लोनिंग सक्षम बनाता है, जिसने MiniMax-MLS-Test और Seed-TTS-eval बेंचमार्क पर प्रतिस्पर्धी परिणाम प्राप्त किए हैं।
- FireRedTTS3-Instruct एकल एकीकृत मॉडल के भीतर प्राकृतिक भाषा वक्ता डिज़ाइन और मुक्त-प्रारूप वक्ता संपादन (अर्थपूर्ण और ध्वनिक) की अनुमति देता है।
इन रिलीजों ने उपयोगकर्ताओं को जटिल ऑडियो संदर्भों को समझने और उच्च-फिडेलिटी, बहुभाषी वक्ता उत्पन्न करने के लिए व्यापक उपकरण प्रदान किए हैं।