FireRedTeam은 두 가지 새로운 오픈소스 오디오 모델을 출시했습니다: 범용 오디오 언어 모델인 FireRedAudio와 통합 음성 생성 및 편집 시스템인 FireRedTTS3입니다.
- FireRedAudio는 분리된 연속 표현을 갖춘 공유 9B 파라미터 LLM을 기반으로 구축되었으며, 최대 1시간 길이의 녹음에 대한 ASR, 오디오 이해, 제로샷 TTS, 지시형 TTS, 의미/음성학적 음성 편집 및 시간적 정렬을 지원합니다.
- FireRedTTS3-Base는 24개 언어와 21개 중국어 방언 전반에서 제로샷 음성 복제를 가능하게 하며, MiniMax-MLS-Test 및 Seed-TTS-eval 벤치마크에서 경쟁력 있는 결과를 달성했습니다.
- FireRedTTS3-Instruct은 단일 통합 모델 내에서 자연어 기반 음성 설계와 자유 형식의 음성 편집(의미 및 음성학적)을 허용합니다.
이러한 출시로 사용자는 복잡한 오디오 맥락을 이해하고 고품질의 다국어 음성을 생성하기 위한 포괄적인 도구를 갖추게 되었습니다.