研究者らは、自然な抑揚を維持しつつ単一の消費者向けGPUからのストリーミング推論を可能にするテキスト音声合成モデル「TontaubeV1」を発表した。本システムは、意味的なストリームと音響的詳細を分離するために12.5 Hzの階層的DualCodec表現を使用し、基盤となるコーデックが非因果的であるにもかかわらず因果的なデコーディングを可能にしている。

  • アーキテクチャは合計2.9Bのパラメータを持つ4つのQwen3由来のトランスフォーマーを採用しており、1つが意味ストリームと発話長を予測し、他の3つが段階的に小さなモデルとして音響的詳細を追加する。
  • テキストは文字ごとにトークン化され、有界コンテキストを通じて長時間形式の生成をサポートするペアリングされたテキストおよびオーディオマーカーを使用する。
  • 単一のRTX 5090において、ストリーミングパスは最初の音声出力まで約200 msを要し、1つの入力に対してエンドツーエンドのリアルタイム係数は0.08となる。
  • モデルはLLM-as-a-judge評価において抑揚面でElevenLabs Flash v2.5と同等であり、Fish Audio S2 Pro、Gradium API、Cartesia Sonic 3を上回る。

本リリースは、高い知覚品質と低遅延のバランスを取るソリューションを提供し、アクセス可能なハードウェアでのリアルタイムアプリケーションに適している。