Google a publié deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, élargissant la famille Gemini Audio pour offrir des capacités de génération vocale dynamique aux créateurs, développeurs et entreprises.

  • Gemini 3.8 Flash TTS permet un contrôle créatif approfondi, permettant aux utilisateurs de créer de nouvelles voix à partir de zéro à l'aide d'invites en langage naturel et de contrôler les indicateurs de performance ligne par ligne.
  • Gemini 3.8 Flash-Lite TTS est optimisé pour une mise à l'échelle volumineuse et rentable, prenant en charge le doublage et des agents vocaux expressifs avec un contrôle fin du ton et du rythme.
  • Les modèles prennent en charge plus de 100 langues et dialectes, y compris des variétés régionales comme l'espagnol mexicain et l'anglais écossais, et offrent une bibliothèque de plus de 2 000 voix prêtes pour la production.
  • Les fonctionnalités de réplique vocale permettent aux utilisateurs de recréer des profils vocaux à partir d'un échantillon de 30 secondes, soutenues par la vérification du consentement, le filigrane SynthID et les identifiants C2PA.
  • Les deux modèles ont obtenu les meilleures positions sur les benchmarks de Hume AI, avec Gemini 3.8 Flash TTS en tête de l'indice de qualité globale et du benchmark de conception vocale.

Ces outils sont désormais disponibles dans Google AI Studio et l'API Gemini pour les développeurs, tandis que l'accès aux entreprises arrivera bientôt via Gemini Enterprise.