研究人员展示了 TontaubeV1,这是一种文本转语音模型,在保持自然韵律的同时,支持从单张消费级 GPU 进行流式推理。该系统使用 12.5 Hz 的层级 DualCodec 表示法,将语义流与声学细化分离,从而实现低延迟生成。
- 文本按字符分词,并由基于 Qwen3 的 Transformer 处理以预测语句时长。
- 三个逐渐变小的 Transformer 添加声学细化,总计 2.9B 参数。
- 重叠的 DualCodec 重建被映射到 VibeVoice 潜在空间以进行因果解码。
- 该模型接受长达一分钟的参考音频,并支持英语、德语和多语言输入。
- 在单张 RTX 5090 上,流式路径达到首次输出音频约 200 ms,端到端 RTF 为 0.08。
- TontaubeV1 在韵律方面与 ElevenLabs Flash v2.5 持平,并优于 Fish Audio S2 Pro、Gradium API 和 Cartesia Sonic 3。
模型权重已在 Hugging Face 上以 Tontaube Community Model License 1.0 许可证发布。