يقدم الباحثون نموذج TontaubeV1 لتحويل النص إلى كلام يحافظ على الإيقاع الطبيعي مع تمكين الاستدلال بالتدفق من خلال بطاقة رسوميات استهلاكية واحدة. يستخدم النظام تمثيل DualCodec الهرمي بمعدل 12.5 هرتز لفصل التدفقات الدلالية عن التحسينات الصوتية، مما يتيح توليدًا منخفض التأخير.

  • يتم تجزئة النص حسب الحرف ومعالجته بواسطة محولات مستمدة من Qwen3 للتنبؤ بفترة النطق.
  • تضيف ثلاثة محولات أصغر تدريجيًا تحسينات صوتية، ليصل إجمالي المعاملات إلى 2.9 مليار.
  • تُربط إعادة بناء DualCodec المتداخلة في فضاء VibeVoice الكامن للاستدلال السببي.
  • يقبل النموذج حتى دقيقة واحدة من الصوت المرجعي ويدعم المدخلات بالإنجليزية والألمانية والمتعددة اللغات.
  • على بطاقة RTX 5090 واحدة، يصل مسار التدفق إلى حوالي 200 مللي ثانية للأول صوت مع معامل زمن حقيقي (RTF) شامل يبلغ 0.08.
  • يساوي TontaubeV1 أداء ElevenLabs Flash v2.5 ويتفوق على Fish Audio S2 Pro وGradium API وCartesia Sonic 3 من حيث الإيقاع.

تم إصدار أوزان النموذج على Hugging Face بموجب ترخيص نموذج مجتمع Tontaube 1.0.