शोधकर्ताओं ने TontaubeV1 प्रस्तुत किया, जो एक प्राकृतिक ध्वनिछटा (prosody) को बनाए रखने वाला टेक्स्ट-टू-स्पीच मॉडल है और एक ही उपभोक्ता GPU से स्ट्रीमिंग इनफरेंस को सक्षम बनाता है। सिस्टम 12.5 Hz पर हियरार्किकल DualCodec प्रतिनिधित्व का उपयोग करता है ताकि अर्थपूर्ण धाराओं (semantic streams) को एकाउस्टिक रिफाइनमेंट्स से अलग किया जा सके, जिससे कम लेटेन्सी जनरेशन संभव होता है।
- टेक्स्ट को वर्णानुसार टोकनाइज़ किया जाता है और उच्चारण अवधि की भविष्यवाणी करने के लिए Qwen3-निर्मित ट्रान्सफॉर्मर्स द्वारा प्रोसेस किया जाता है।
- तीन क्रमिक रूप से छोटे ट्रान्सफॉर्मर्स एकाउस्टिक रिफाइनमेंट्स जोड़ते हैं, जिसके कुल पैरामीटर 2.9B होते हैं।
- ओवरलैपिंग DualCodec पुनर्निर्माणों को VibeVoice लैटेंट स्पेस में मैप किया जाता है ताकि कैजुअल डिकोडिंग की जा सके।
- मॉडल एक मिनट तक के संदर्भ ऑडियो स्वीकार करता है और अंग्रेजी, जर्मन और बहुभाषी इनपुट का समर्थन करता है।
- एक ही RTX 5090 पर, स्ट्रीमिंग पथ लगभग 200 ms में पहली ऑडियो तक पहुँचता है और एंड-टू-एंड RTF 0.08 होता है।
- TontaubeV1 ElevenLabs Flash v2.5 के बराबर है और ध्वनिछटा (prosody) पर Fish Audio S2 Pro, Gradium API, और Cartesia Sonic 3 से बेहतर प्रदर्शन करता है।
मॉडल वजन Tontaube Community Model License 1.0 के तहत Hugging Face पर जारी किए गए हैं।