Google은 Gemini API와 AI Studio를 통해 Gemini 3.8 Flash TTS 및 Flash-Lite TTS를 출시했으며, Hume의 Voice Design Benchmark 및 Voice Arena에서 6개 언어로 상위 랭킹을 달성했습니다.
- 사용자는 이제 동의 기반 클립 두 개를 녹음하여 음성을 복제하거나 기존 녹음 없이 단일 문장에서 새 음성을 디자인할 수 있습니다.
- API는 <short pause>와 같은 인라인 효과음과 speech_metadata.style을 통한 상세한 전달 스타일을 지원합니다.
- 복제된 음성은 재사용 가능하지만, 동의 없는 음성은 7일 후 만료되는 암호화된 키로 저장할 수 있습니다.
- 프롬프팅이 크게 변경되었습니다: 텍스트 내 지침은 음성으로 읽히며, 다중 화자 턴에는 명시적인 화자 태그가 필요하고, 긴 Audio Profile 프롬프트는 음성 드리프트를 유발할 수 있습니다.
이 업데이트는 합성 음성 생성에 대한 정밀한 제어를 가능하게 하지만, gemini-3.1-flash-tts-preview 버전의 기존 프롬프트는 마이그레이션 없이 중단됩니다.