Google a publié Gemini 3.8 Flash TTS et Flash-Lite TTS via l'API Gemini et AI Studio, atteignant les premiers rangs du Voice Design Benchmark et de Voice Arena de Hume dans six langues.

  • Les utilisateurs peuvent désormais répliquer une voix en enregistrant deux clips basés sur le consentement ou concevoir une nouvelle voix à partir d'une seule phrase sans enregistrements précédents.
  • L'API prend en charge les effets sonores inline comme <short pause> et des styles de livraison détaillés via speech_metadata.style.
  • Les voix répliquées sont réutilisables, tandis que les voix non consenties peuvent être stockées sous forme de clés chiffrées expirant après sept jours.
  • Le prompting a considérablement changé : les instructions dans le texte sont prononcées à voix haute, les tours multi-intervenants nécessitent des balises d'intervenant explicites, et les longs prompts Audio Profile peuvent provoquer une dérive vocale.

La mise à jour permet un contrôle précis de la génération de voix synthétique, bien que les prompts existants de la version gemini-3.1-flash-tts-preview soient cassés sans migration.