A Google lançou dois novos modelos de texto para fala: gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts, com uma biblioteca de mais de 2.000 vozes.
A API suporta a criação de vozes personalizadas usando apenas uma amostra de áudio de 30 segundos e permite que os usuários definam conversas multilocutoras com estilos de voz distintos.
Nos testes, gerar 1 minuto e 18 segundos de áudio levou aproximadamente 20 segundos e custou 2,74 centavos usando o modelo Flash padrão.