研究人员推出了 TontaubeV1,这是一种文本转语音模型,在保持自然韵律的同时,支持从单个消费级 GPU 进行流式推理。该系统使用 12.5 Hz 的层次化 DualCodec 表示法,将语义流与声学细化分离开来,从而尽管底层编解码器具有非因果特性,仍可实现因果解码。
- 该架构采用四个源自 Qwen3 的 Transformer 模型,总计包含 2.9B 参数:一个用于预测语义流和语句时长,另外三个逐渐变小的模型则添加声学细化。
- 文本按字符进行分词,配对的文本和音频标记通过有界上下文支持长篇幅生成。
- 在单个 RTX 5090 上,流式路径实现约 200 ms 的首个音频延迟,端到端实时因子为 0.08(针对单次输入)。
- 在基于 LLM 的裁判评估中,该模型在韵律方面与 ElevenLabs Flash v2.5 持平,并优于 Fish Audio S2 Pro、Gradium API 和 Cartesia Sonic 3。
此次发布提供了一种平衡高感知质量与低延迟的解决方案,使其适用于可访问硬件上的实时应用。