Исследователи представляют модель синтеза речи из текста TontaubeV1, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одном потребительском GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что обеспечивает генерацию с низкой задержкой.
- Текст токенизируется посимвольно и обрабатывается трансформерами на базе Qwen3 для прогнозирования длительности высказывания.
- Три последовательно уменьшающихся трансформера добавляют акустические уточнения, в сумме составляя 2.9B параметров.
- Перекрывающиеся реконструкции DualCodec отображаются в латентное пространство VibeVoice для каузального декодирования.
- Модель принимает до одной минуты референсного аудио и поддерживает английский, немецкий языки, а также многоязычный ввод.
- На одном RTX 5090 путь потоковой генерации достигает примерно 200 мс до появления первого аудио при сквозном RTF 0.08.
- TontaubeV1 соответствует ElevenLabs Flash v2.5 и превосходит Fish Audio S2 Pro, Gradium API и Cartesia Sonic 3 по качеству просодии.
Веса модели опубликованы на Hugging Face под лицензией Tontaube Community Model License 1.0.