Google a publié deux nouveaux modèles de synthèse vocale, gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts, dotés d'une bibliothèque de plus de 2 000 voix.

L'API permet de créer des voix personnalisées à partir d'un simple échantillon audio de 30 secondes et permet aux utilisateurs de définir des conversations multi-intervenants avec des styles vocaux distincts.

Lors des tests, la génération de 1 minute et 18 secondes d'audio a pris environ 20 secondes et a coûté 2,74 cents en utilisant le modèle Flash standard.