أطلق فريق FireRedTeam نموذجين جديدين مفتوحا المصدر للصوت: FireRedAudio، وهو نموذج لغوي عام للصوت، وFireRedTTS3، وهو نظام موحد لتوليد الكلام وتحريره.
- يُبنى FireRedAudio على نموذج لغوي كبير (LLM) مشترك يحتوي على 9 مليارات معلمة مع تمثيلات مستمرة منفصلة، ويدعم التعرف التلقائي على الكلام (ASR)، وفهم الصوت، وتوليد الكلام من صفر (zero-shot TTS)، وتوليد الكلام بالتعليمات (instruct TTS)، وتحرير الكلام الدلالي/الصوتي، والتأريض الزمني للتسجيلات التي تصل مدتها إلى ساعة واحدة.
- يتيح FireRedTTS3-Base استنساخ الصوت من صفر عبر 24 لغة و21 لهجة صينية، محققاً نتائج تنافسية على معيار MiniMax-MLS-Test ومعيار Seed-TTS-eval.
- يسمح FireRedTTS3-Instruct بتصميم الصوت بلغة طبيعية وتحرير الكلام بحرية (دلالي وصوتي) ضمن نموذج موحد واحد.
توفر هذه الإصدارات للمستخدمين أدوات شاملة لكل من فهم السياقات الصوتية المعقدة وتوليد كلام متعدد اللغات وعالي الدقة.