A Google lançou dois novos modelos de texto-para-fala, Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, como parte de sua família Gemini Audio. Esses modelos introduzem o design generativo de voz a partir de prompts em linguagem natural e a direção de performance linha por linha por meio da API Gemini e do Google AI Studio.
- O Gemini 3.8 Flash TTS é voltado para a direção criativa em jogos e mídia imersiva, ocupando a posição #1 no Benchmark de Design de Voz da Hume AI com uma pontuação de 71.4.
- O Gemini 3.8 Flash-Lite TTS é otimizado para produção em alto volume e com eficiência de custos, como dublagem, e ocupa a posição #2 no Índice Geral de Qualidade da Hume AI.
- O lançamento expande a biblioteca de vozes para mais de 2.000 vozes prontas para produção e permite o design generativo em mais de 100 idiomas.
- Ambos os modelos suportam nativamente a encenação com dois locutores, explosões vocais, backchanneling e geração de conteúdo longo com qualidade consistente.
- A replicação de voz requer uma amostra de 30 segundos e consentimento verbal, com todas as saídas marcadas por SynthID.
Os modelos oferecem aos desenvolvedores controle granular sobre tom, ritmo e design de personagens, ao mesmo tempo que fornecem opções escaláveis para diferentes necessidades de produção.