구글은 크리에이터, 개발자, 기업에게 동적 음성 생성 기능을 제공하기 위해 제미니 오디오 패밀리를 확장하는 두 가지 새로운 텍스트 음성 변환(TTS) 모델인 제미니 3.8 플래시 TTS와 제미니 3.8 플래시-라이트 TTS를 출시했습니다.
- 제미니 3.8 플래시 TTS는 심층적인 창의적 지시를 가능하게 하여 사용자가 자연어 프롬프트를 사용하여 처음부터 새로운 음성을 생성하고 라인별 성능 단서를 제어할 수 있습니다.
- 제미니 3.8 플래시-라이트 TTS는 대량 처리와 비용 효율적인 확장성을 위해 최적화되어 있으며, 톤과 속도에 대한 세밀한 제어가 가능한 더빙 및 표현력 있는 음성 에이전트를 지원합니다.
- 이 모델들은 멕시코 스페인어나 스코틀랜드 영어와 같은 지역 변종을 포함하여 100개 이상의 언어와 방언을 지원하며, 2,000개 이상의 프로덕션 준비 완료된 음성 라이브러리를 제공합니다.
- 음성 복제 기능을 통해 사용자는 동의 확인, SynthID 워터마킹, C2PA 자격 증명을 기반으로 한 30초 샘플에서 음성 프로필을 재현할 수 있습니다.
- 두 모델 모두 Hume AI의 벤치마크에서 상위 위치를 차지했으며, 제미니 3.8 플래시 TTS는 전체 품질 지수와 음성 디자인 벤치마크에서 선두를 달리고 있습니다.
이 도구들은 이제 개발자를 위해 Google AI Studio와 Gemini API에서 사용 가능하며, 기업용 접근은 곧 Gemini Enterprise를 통해 제공될 예정입니다.