Google выпустила две новые модели преобразования текста в речь: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, в рамках семейства Gemini Audio. Эти модели предлагают генеративный дизайн голоса по текстовым запросам и пословное управление исполнением через Gemini API и Google AI Studio.
- Gemini 3.8 Flash TTS ориентирована на творческое управление для игр и иммерсивных медиа, заняв #1 место в бенчмарке Hume AI Voice Design Benchmark со счетом 71.4.
- Gemini 3.8 Flash-Lite TTS оптимизирована для массового и экономичного производства, такого как дубляж, и заняла #2 место в индексе общего качества Hume AI Overall Quality Index.
- Обновление расширяет библиотеку голосов до более чем 2000 готовых к использованию вариантов и поддерживает генеративный дизайн на более чем 100 языках.
- Обе модели поддерживают нативную постановку для двух говорящих, вокальные акценты, фоновые реплики и длинноформатную генерацию с постоянным качеством.
- Для репликации голоса требуется образец длительностью 30 секунд и устное согласие, все выходные данные маркируются водяным знаком SynthID.
Модели предоставляют разработчикам детальный контроль над тоном, темпом и дизайном персонажей, а также предлагают масштабируемые решения для различных производственных задач.