研究者らは、TontaubeV1を発表した。これは自然な抑揚を維持しつつ、単一の消費者向けGPUからストリーミング推論を可能にする音声合成モデルである。本システムは、意味的なストリームと音響的詳細を分離するために、12.5 Hzの階層的DualCodec表現を使用し、低遅延生成を実現する。

  • テキストは文字ごとにトークン化され、発話長を予測するためにQwen3由来のトランスフォーマーによって処理される。
  • 3つの段階的に小さくなるトランスフォーマーが音響的詳細を追加し、合計2.9Bパラメータとなる。
  • 重複するDualCodec再構築は、因果的なデコーディングのためにVibeVoice潜在空間にマッピングされる。
  • モデルは最大1分間の参照音声を受け付け、英語、ドイツ語、多言語の入力をサポートする。
  • 単一のRTX 5090上では、ストリーミングパスの最初の音声までの遅延は約200 msで、エンドツーエンドのRTFは0.08である。
  • TontaubeV1はElevenLabs Flash v2.5と同等であり、抑揚においてFish Audio S2 Pro、Gradium API、Cartesia Sonic 3を上回る。

モデルの重みは、Tontaube Community Model License 1.0の下でHugging Faceに公開されている。