Pesquisadores apresentam o TontaubeV1, um modelo de texto-para-fala que preserva a prosódia natural enquanto permite inferência em streaming a partir de uma única GPU de consumo. O sistema utiliza uma representação DualCodec hierárquica a 12.5 Hz para separar fluxos semânticos de refinamentos acústicos, permitindo decodificação causal apesar da natureza não causal do codec subjacente.

  • A arquitetura emprega quatro transformadores derivados do Qwen3 totalizando 2.9B parâmetros: um prevê o fluxo semântico e a duração da utterance, enquanto três modelos progressivamente menores adicionam refinamentos acústicos.
  • O texto é tokenizado por caractere, com marcadores de texto e áudio emparelhados suportando geração de longo formato através de contexto limitado.
  • Em uma única RTX 5090, o caminho de streaming alcança aproximadamente 200 ms para o primeiro áudio, com um fator de tempo real de ponta a ponta de 0.08 para uma entrada.
  • O modelo iguala o ElevenLabs Flash v2.5 e supera o Fish Audio S2 Pro, Gradium API e Cartesia Sonic 3 em prosódia nas avaliações de LLM-as-a-judge.

O lançamento fornece uma solução que equilibra alta qualidade perceptiva com baixa latência, tornando-o adequado para aplicações em tempo real em hardware acessível.