Pesquisadores apresentam o TontaubeV1, um modelo de texto-para-fala que preserva a prosódia natural enquanto permite inferência em streaming a partir de uma única GPU de consumo. O sistema utiliza uma representação DualCodec hierárquica a 12,5 Hz para separar fluxos semânticos de refinamentos acústicos, permitindo geração de baixa latência.

  • O texto é tokenizado por caractere e processado por transformers derivados do Qwen3 para prever a duração da fala.
  • Três transformers progressivamente menores adicionam refinamentos acústicos, totalizando 2,9B parâmetros.
  • Reconstruções DualCodec sobrepostas são mapeadas no espaço latente VibeVoice para decodificação causal.
  • O modelo aceita até um minuto de áudio de referência e suporta entradas em inglês, alemão e multilíngues.
  • Em uma única RTX 5090, o caminho de streaming atinge aproximadamente 200 ms para o primeiro áudio com um RTF end-to-end de 0,08.
  • TontaubeV1 iguala o ElevenLabs Flash v2.5 e supera Fish Audio S2 Pro, Gradium API e Cartesia Sonic 3 em prosódia.

Os pesos do modelo são lançados no Hugging Face sob a Licença Modelo Comunitária Tontaube 1.0.