Google ha lanzado dos nuevos modelos de texto a voz: gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts, que cuentan con una biblioteca de más de 2000 voces.
La API permite crear voces personalizadas utilizando solo una muestra de audio de 30 segundos y posibilita a los usuarios definir conversaciones multihablante con estilos de voz distintos.
En las pruebas, generar 1 minuto y 18 segundos de audio tomó aproximadamente 20 segundos y costó 2,74 centavos utilizando el modelo Flash estándar.