Google a publié Gemini 3.8 Flash TTS et Flash-Lite TTS via l'API Gemini et AI Studio, atteignant les premiers rangs du Voice Design Benchmark et de Voice Arena de Hume dans six langues.
- Les utilisateurs peuvent désormais répliquer une voix en enregistrant deux clips basés sur le consentement ou concevoir une nouvelle voix à partir d'une seule phrase sans enregistrements précédents.
- L'API prend en charge les effets sonores inline comme <short pause> et des styles de livraison détaillés via speech_metadata.style.
- Les voix répliquées sont réutilisables, tandis que les voix non consenties peuvent être stockées sous forme de clés chiffrées expirant après sept jours.
- Le prompting a considérablement changé : les instructions dans le texte sont prononcées à voix haute, les tours multi-intervenants nécessitent des balises d'intervenant explicites, et les longs prompts Audio Profile peuvent provoquer une dérive vocale.
La mise à jour permet un contrôle précis de la génération de voix synthétique, bien que les prompts existants de la version gemini-3.1-flash-tts-preview soient cassés sans migration.