Google выпустила две новые модели преобразования текста в речь: gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts, оснащенные библиотекой из более чем 2000 голосов.
API поддерживает создание пользовательских голосов на основе всего 30-секундного аудиофрагмента и позволяет пользователям определять многорежимные диалоги с различными стилями голоса.
При тестировании генерация аудио длительностью 1 минута 18 секунд заняла около 20 секунд и стоила 2,74 цента при использовании стандартной модели Flash.