يقدم الباحثون نموذج TontaubeV1، وهو نموذج لتحويل النص إلى كلام يحافظ على الإيقاع الطبيعي مع تمكين الاستدلال المتدفق من بطاقة رسومات استهلاكية واحدة. يستخدم النظام تمثيل DualCodec هرمي بمعدل 12.5 هرتز لفصل التدفقات الدلالية عن التحسينات الصوتية، مما يسمح بالفك التسببي رغم الطبيعة غير التسببية للترميز الأساسي.
- يعتمد الهيكل على أربعة محولات مشتقة من Qwen3 بإجمالي 2.9 مليار معلمة: واحد يتنبأ بالتدفق الدلالي ومدة النطق، بينما تضيف ثلاثة نماذج أصغر تدريجياً تحسينات صوتية.
- يتم تجزئة النص حرفاً بحرف، مع دعم علامات النص والصوت المزدوجة للتوليد طويل المدى عبر سياق محدود.
- على بطاقة RTX 5090 واحدة، يحقق مسار البث المباشر حوالي 200 مللي ثانية حتى أول صوت، مع عامل زمني حقيقي نهائي قدره 0.08 لإدخال واحد.
- يساوي النموذج أداء ElevenLabs Flash v2.5 ويتفوق على Fish Audio S2 Pro وGradium API وCartesia Sonic 3 في الإيقاع ضمن تقييمات الحكم باستخدام نموذج لغوي كبير.
يوفر هذا الإصدار حلاً يوازن بين جودة إدراكية عالية وزمن استجابة منخفض، مما يجعله مناسباً للتطبيقات الزمنية الحقيقية على أجهزة متاحة.