Исследователи представляют модель синтеза речи из текста TontaubeV1, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одном потребительском GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что обеспечивает генерацию с низкой задержкой.

  • Текст токенизируется посимвольно и обрабатывается трансформерами на базе Qwen3 для прогнозирования длительности высказывания.
  • Три последовательно уменьшающихся трансформера добавляют акустические уточнения, в сумме составляя 2.9B параметров.
  • Перекрывающиеся реконструкции DualCodec отображаются в латентное пространство VibeVoice для каузального декодирования.
  • Модель принимает до одной минуты референсного аудио и поддерживает английский, немецкий языки, а также многоязычный ввод.
  • На одном RTX 5090 путь потоковой генерации достигает примерно 200 мс до появления первого аудио при сквозном RTF 0.08.
  • TontaubeV1 соответствует ElevenLabs Flash v2.5 и превосходит Fish Audio S2 Pro, Gradium API и Cartesia Sonic 3 по качеству просодии.

Веса модели опубликованы на Hugging Face под лицензией Tontaube Community Model License 1.0.