Les chercheurs présentent TontaubeV1, un modèle de synthèse vocale qui préserve une prosodie naturelle tout en permettant une inférence en streaming sur un seul GPU grand public. Le système utilise une représentation DualCodec hiérarchique à 12,5 Hz pour séparer les flux sémantiques des raffinements acoustiques, permettant un décodage causal malgré la nature non causale du codec sous-jacent.

  • L'architecture emploie quatre transformeurs dérivés de Qwen3 totalisant 2,9 milliards de paramètres : l'un prédit le flux sémantique et la durée de l'énoncé, tandis que trois modèles de plus en plus petits ajoutent des raffinements acoustiques.
  • Le texte est tokenisé caractère par caractère, avec des marqueurs de texte et d'audio appariés prenant en charge la génération longue forme grâce à un contexte borné.
  • Sur un seul RTX 5090, le chemin de streaming atteint environ 200 ms jusqu'à la première audio, avec un facteur temps réel de bout en bout de 0,08 pour une entrée.
  • Le modèle égale ElevenLabs Flash v2.5 et surpasse Fish Audio S2 Pro, Gradium API et Cartesia Sonic 3 en prosodie dans les évaluations par juge LLM-as-a-judge.

La publication offre une solution qui équilibre une qualité perceptive élevée avec une faible latence, la rendant adaptée aux applications en temps réel sur du matériel accessible.