Google ha lanzado Gemini 3.8 Flash TTS y Flash-Lite TTS a través de la API de Gemini y AI Studio, alcanzando los primeros puestos en el Voice Design Benchmark y Voice Arena de Hume en seis idiomas.

  • Los usuarios ahora pueden replicar una voz grabando dos clips con consentimiento o diseñar uno nuevo a partir de una sola oración sin grabaciones previas.
  • La API admite efectos de sonido en línea como <short pause> y estilos detallados de entrega mediante speech_metadata.style.
  • Las voces replicadas son reutilizables, mientras que las voces no consentidas pueden almacenarse como claves cifradas con caducidad tras siete días.
  • El prompting ha cambiado significativamente: las instrucciones dentro del texto se leen en voz alta, los turnos de múltiples hablantes requieren etiquetas explícitas de hablante, y los prompts largos de Audio Profile pueden causar deriva de voz.

La actualización permite un control preciso sobre la generación de voz sintética, aunque los prompts existentes de la versión gemini-3.1-flash-tts-preview se romperán sin migración.