Google ha lanzado dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, como parte de su familia Gemini Audio. Estos modelos introducen el diseño generativo de voz a partir de prompts de lenguaje natural y la dirección de actuación línea por línea a través de la API de Gemini y Google AI Studio.

  • Gemini 3.8 Flash TTS se dirige a la dirección creativa para videojuegos y medios inmersivos, ocupando el puesto #1 en el Hume AI Voice Design Benchmark con una puntuación de 71.4.
  • Gemini 3.8 Flash-Lite TTS está optimizado para producciones de alto volumen y rentables, como el doblaje, y ocupa el puesto #2 en el Hume AI Overall Quality Index.
  • El lanzamiento amplía la biblioteca de voces a más de 2.000 voces listas para producción y permite el diseño generativo en más de 100 idiomas.
  • Ambos modelos admiten la escenificación nativa de dos hablantes, explosiones vocales, retroalimentación conversacional y generación de formato largo con calidad consistente.
  • La replicación de voz requiere una muestra de 30 segundos y consentimiento verbal, con todas las salidas marcadas por SynthID.

Los modelos proporcionan a los desarrolladores un control granular sobre el tono, el ritmo y el diseño de personajes, mientras ofrecen opciones escalables para diferentes necesidades de producción.