Google ha lanzado dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, como parte de su familia Gemini Audio. Estos modelos introducen el diseño generativo de voz a partir de prompts de lenguaje natural y la dirección de actuación línea por línea a través de la API de Gemini y Google AI Studio.
- Gemini 3.8 Flash TTS se dirige a la dirección creativa para videojuegos y medios inmersivos, ocupando el puesto #1 en el Hume AI Voice Design Benchmark con una puntuación de 71.4.
- Gemini 3.8 Flash-Lite TTS está optimizado para producciones de alto volumen y rentables, como el doblaje, y ocupa el puesto #2 en el Hume AI Overall Quality Index.
- El lanzamiento amplía la biblioteca de voces a más de 2.000 voces listas para producción y permite el diseño generativo en más de 100 idiomas.
- Ambos modelos admiten la escenificación nativa de dos hablantes, explosiones vocales, retroalimentación conversacional y generación de formato largo con calidad consistente.
- La replicación de voz requiere una muestra de 30 segundos y consentimiento verbal, con todas las salidas marcadas por SynthID.
Los modelos proporcionan a los desarrolladores un control granular sobre el tono, el ritmo y el diseño de personajes, mientras ofrecen opciones escalables para diferentes necesidades de producción.