구글은 Gemini 오디오 패밀리의 일환으로 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS라는 두 가지 새로운 텍스트 음성 변환 모델을 출시했습니다. 이 모델들은 Gemini API와 Google AI Studio를 통해 자연어 프롬프트에서 생성되는 음성 디자인과 줄 단위의 연기 지시를 도입합니다.

  • Gemini 3.8 Flash TTS는 게임 및 몰입형 미디어의 창의적 지향을 목표로 하며, Hume AI Voice Design Benchmark에서 71.4점의 점수로 1위를 차지했습니다.
  • Gemini 3.8 Flash-Lite TTS는 더빙과 같은 대량 생산에 최적화되어 있으며, Hume AI Overall Quality Index에서 2위를 기록했습니다.
  • 이번 출시로 제작 준비가 완료된 음성의 라이브러리가 2,000개 이상으로 확장되었으며, 100개 이상의 언어에서 생성형 디자인이 가능해졌습니다.
  • 두 모델 모두 네이티브 스피커 배치, 보컬 버스트, 백채널링, 일관된 품질을 유지하는 장문 생성을 지원합니다.
  • 음성 복제에는 30초 분량의 샘플과 구두 동의가 필요하며, 모든 출력물은 SynthID로 워터마킹됩니다.

이 모델들은 개발자에게 톤, 템포 및 캐릭터 디자인에 대한 세밀한 제어를 제공하면서도 다양한 제작 요구사항에 맞는 확장 가능한 옵션을 제공합니다.