Google a publié deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, dans le cadre de sa famille Gemini Audio. Ces modèles introduisent la conception vocale générative à partir de prompts en langage naturel et la direction des performances ligne par ligne via l'API Gemini et Google AI Studio.

  • Gemini 3.8 Flash TTS cible la direction créative pour les jeux vidéo et les médias immersifs, se classant #1 sur le Hume AI Voice Design Benchmark avec un score de 71.4.
  • Gemini 3.8 Flash-Lite TTS est optimisé pour la production à haut volume et rentable, comme le doublage, et se classe #2 sur l'indice global de qualité Hume AI.
  • Cette publication élargit la bibliothèque vocale à plus de 2 000 voix prêtes pour la production et permet la conception générative dans plus de 100 langues.
  • Les deux modèles prennent en charge nativement la mise en scène à deux locuteurs, les explosions vocales, les réactions d'écoute et la génération longue forme avec une qualité constante.
  • La réplication vocale nécessite un échantillon de 30 secondes et le consentement verbal, toutes les sorties étant marquées par SynthID.

Les modèles offrent aux développeurs un contrôle granulaire sur le ton, le rythme et la conception des personnages tout en proposant des options évolutives pour différents besoins de production.