Google ha lanzado dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, ampliando la familia Gemini Audio para ofrecer capacidades de generación de voz dinámica para creadores, desarrolladores y empresas.
- Gemini 3.8 Flash TTS permite una dirección creativa profunda, permitiendo a los usuarios crear nuevas voces desde cero mediante indicaciones en lenguaje natural y controlar las pistas de interpretación línea por línea.
- Gemini 3.8 Flash-Lite TTS está optimizado para un alto volumen y escalabilidad eficiente en costos, apoyando la doblaje y agentes de voz expresivos con control fino sobre el tono y el ritmo.
- Los modelos admiten más de 100 idiomas y dialectos, incluidas variedades regionales como el español mexicano y el inglés escocés, y ofrecen una biblioteca de más de 2.000 voces listas para producción.
- Las funciones de replicación de voz permiten a los usuarios recrear perfiles vocales a partir de una muestra de 30 segundos, respaldadas por verificación de consentimiento, marca de agua SynthID y credenciales C2PA.
- Ambos modelos obtuvieron las primeras posiciones en las pruebas de Hume AI, con Gemini 3.8 Flash TTS liderando el Índice de Calidad General y la Prueba de Diseño de Voz.
Estas herramientas ya están disponibles en Google AI Studio y la API de Gemini para desarrolladores, mientras que el acceso empresarial llegará pronto a través de Gemini Enterprise.