Google выпустила две новые модели синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, расширяя семейство Gemini Audio для предоставления возможностей динамической генерации голоса создателям, разработчикам и предприятиям.

  • Gemini 3.8 Flash TTS обеспечивает глубокое творческое управление, позволяя пользователям создавать новые голоса с нуля с помощью текстовых подсказок на естественном языке и управлять характеристиками исполнения построчно.
  • Gemini 3.8 Flash-Lite TTS оптимизирован для масштабируемости при высоких объемах и низкой стоимости, поддерживая дубляж и выразительных голосовых агентов с тонким контролем над тоном и темпом.
  • Модели поддерживают более 100 языков и диалектов, включая региональные варианты, такие как мексиканский испанский и шотландский английский, и предлагают библиотеку из более чем 2000 готовых к использованию голосов.
  • Функция репликации голоса позволяет пользователям воссоздавать вокальные профили по 30-секундному образцу с проверкой согласия, внедрением водяного знака SynthID и учетными данными C2PA.

Обе модели заняли лидирующие позиции в бенчмарках Hume AI: Gemini 3.8 Flash TTS возглавил Общий индекс качества и бенчмарк Voice Design Benchmark.

Эти инструменты теперь доступны в Google AI Studio и Gemini API для разработчиков, а доступ для предприятий скоро появится через Gemini Enterprise.