Les chercheurs présentent TontaubeV1, un modèle de synthèse vocale qui préserve la prosodie naturelle tout en permettant une inférence en streaming sur un seul GPU grand public. Le système utilise une représentation DualCodec hiérarchique à 12,5 Hz pour séparer les flux sémantiques des raffinements acoustiques, ce qui permet une génération à faible latence.

  • Le texte est tokenisé caractère par caractère et traité par des transformeurs dérivés de Qwen3 pour prédire la durée des énoncés.
  • Trois transformeurs de plus en plus petits ajoutent des raffinements acoustiques, totalisant 2,9 milliards de paramètres.
  • Les reconstructions DualCodec chevauchantes sont mappées dans l'espace latent VibeVoice pour un décodage causal.
  • Le modèle accepte jusqu'à une minute d'audio de référence et prend en charge les entrées en anglais, en allemand et multilingues.
  • Sur un seul RTX 5090, le chemin de streaming atteint environ 200 ms avant la première sortie audio avec un RTF (temps réel) de bout en bout de 0,08.
  • TontaubeV1 égale ElevenLabs Flash v2.5 et surpasse Fish Audio S2 Pro, Gradium API et Cartesia Sonic 3 en termes de prosodie.

Les poids du modèle sont publiés sur Hugging Face sous la licence Tontaube Community Model License 1.0.