Исследователи представляют TontaubeV1 — модель преобразования текста в речь, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одной потребительской GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что позволяет осуществлять каузальное декодирование, несмотря на некаузальный характер базового кодека.

  • Архитектура использует четыре трансформера на базе Qwen3 с общим числом параметров 2.9B: один предсказывает семантический поток и длительность высказывания, а три последовательно уменьшающиеся модели добавляют акустические уточнения.
  • Текст токенизируется по символам; парные маркеры текста и аудио поддерживают генерацию длинных форм благодаря ограниченному контексту.
  • На одной RTX 5090 путь потоковой передачи достигает примерно 200 мс до появления первого аудио, а коэффициент реального времени в конце-в-конце составляет 0.08 для одного ввода.
  • Модель сопоставима с ElevenLabs Flash v2.5 и превосходит Fish Audio S2 Pro, Gradium API и Cartesia Sonic 3 по качеству просодии в оценках LLM-as-a-judge.

Выпуск предлагает решение, которое балансирует между высоким воспринимаемым качеством и низкой задержкой, что делает его подходящим для приложений реального времени на доступном оборудовании.