Pesquisadores apresentam o TontaubeV1, um modelo de texto-para-fala que preserva a prosódia natural enquanto permite inferência em streaming a partir de uma única GPU de consumo. O sistema utiliza uma representação DualCodec hierárquica a 12,5 Hz para separar fluxos semânticos de refinamentos acústicos, permitindo geração de baixa latência.
- O texto é tokenizado por caractere e processado por transformers derivados do Qwen3 para prever a duração da fala.
- Três transformers progressivamente menores adicionam refinamentos acústicos, totalizando 2,9B parâmetros.
- Reconstruções DualCodec sobrepostas são mapeadas no espaço latente VibeVoice para decodificação causal.
- O modelo aceita até um minuto de áudio de referência e suporta entradas em inglês, alemão e multilíngues.
- Em uma única RTX 5090, o caminho de streaming atinge aproximadamente 200 ms para o primeiro áudio com um RTF end-to-end de 0,08.
- TontaubeV1 iguala o ElevenLabs Flash v2.5 e supera Fish Audio S2 Pro, Gradium API e Cartesia Sonic 3 em prosódia.
Os pesos do modelo são lançados no Hugging Face sob a Licença Modelo Comunitária Tontaube 1.0.