शोधकर्ताओं ने TontaubeV1 प्रस्तुत किया, एक टेक्स्ट-टू-स्पीच मॉडल जो प्राकृतिक प्रसोडी को बनाए रखते हुए एकल उपभोक्ता GPU से स्ट्रीमिंग इनफरेंस को सक्षम बनाता है। सिस्टम अंतर्निहित कोडेक की नॉनकेजुअल प्रकृति के बावजूद कैजुअल डिकोडिंग की अनुमति देकर, सेमांटिक स्ट्रीम्स को एकोस्टिक रिफाइनमेंट्स से अलग करने के लिए 12.5 Hz पर एक हियरार्किकल DualCodec प्रतिनिधित्व का उपयोग करता है।
- आर्किटेक्चर कुल 2.9B पैरामीटर वाले चार Qwen3-डेरिव्ड ट्रांसफॉर्मर्स को रोजगार देता है: एक सेमांटिक स्ट्रीम और उच्चारण अवधि की भविष्यवाणी करता है, जबकि तीन क्रमशः छोटे मॉडल एकोस्टिक रिफाइनमेंट्स जोड़ते हैं।
- टेक्स्ट को वर्णानुसार टोकनाइज़ किया जाता है, जिसमें बounded संदर्भ के माध्यम से लंबे-रूप उत्पादन का समर्थन करने वाले युग्मित टेक्स्ट और ऑडियो मार्कर शामिल हैं।
- एकल RTX 5090 पर, स्ट्रीमिंग पथ लगभग 200 ms का पहला ऑडियो प्राप्त करता है, जिसमें एक इनपुट के लिए एंड-टू-एंड रियल-टाइम फैक्टर 0.08 होता है।
- मॉडल LLM-एज-अ-जज मूल्यांकनों में प्रसोडी पर ElevenLabs Flash v2.5 के बराबर है और Fish Audio S2 Pro, Gradium API, और Cartesia Sonic 3 को हराता है।
रिलीज़ एक ऐसा समाधान प्रदान करती है जो उच्च संज्ञानात्मक गुणवत्ता को कम लेटेंसी के साथ संतुलित करती है, जिससे इसे सुलभ हार्डवेयर पर रियल-टाइम अनुप्रयोगों के लिए उपयुक्त बनाया जाता है।