Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS через Gemini API и AI Studio, достигнув верхних позиций в Voice Design Benchmark и Voice Arena от Hume на шести языках.
- Пользователи теперь могут воспроизвести голос, записав два клипа с согласия, или создать новый на основе одного предложения без предварительных записей.
- API поддерживает встроенные звуковые эффекты, такие как <short pause>, и детальные стили подачи через speech_metadata.style.
- Воспроизведенные голоса можно использовать повторно, а голоса без согласия могут храниться в виде зашифрованных ключей, истекающих через семь дней.
- Промптинг значительно изменился: инструкции внутри текста произносятся вслух, многоголосые реплики требуют явных тегов спикера, а длинные промпты Audio Profile могут вызвать дрейф голоса.
Обновление позволяет точно контролировать генерацию синтетического голоса, хотя существующие промпты из версии gemini-3.1-flash-tts-preview сломаются без миграции.