A Google lançou o Gemini 3.8 Flash TTS e o Flash-Lite TTS por meio da API do Gemini e do AI Studio, alcançando as primeiras posições no Voice Design Benchmark e na Voice Arena da Hume em seis idiomas.
- Os usuários agora podem replicar uma voz gravando dois clipes com consentimento ou criar um novo a partir de uma única frase, sem gravações anteriores.
- A API suporta efeitos sonoros inline como <short pause> e estilos detalhados de entrega por meio de speech_metadata.style.
- As vozes replicadas são reutilizáveis, enquanto as vozes não consentidas podem ser armazenadas como chaves criptografadas que expiram após sete dias.
- O prompting mudou significativamente: instruções dentro do texto são faladas em voz alta, turnos de múltiplos locutores exigem tags explícitas de locutor, e prompts longos do Audio Profile podem causar deriva de voz.
A atualização permite controle preciso sobre a geração de voz sintética, embora os prompts existentes da versão gemini-3.1-flash-tts-preview quebrem sem migração.