Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar flujos semánticos de refinamientos acústicos, permitiendo generación de baja latencia.
- El texto se tokeniza por carácter y se procesa mediante transformadores derivados de Qwen3 para predecir la duración del enunciado.
- Tres transformadores progresivamente más pequeños añaden refinamientos acústicos, totalizando 2.9B parámetros.
- Las reconstrucciones DualCodec superpuestas se mapean en el espacio latente VibeVoice para decodificación causal.
- El modelo acepta hasta un minuto de audio de referencia y soporta entradas en inglés, alemán e multilingües.
- En una única RTX 5090, la ruta de streaming alcanza aproximadamente 200 ms hasta el primer audio con un RTF end-to-end de 0.08.
- TontaubeV1 iguala a ElevenLabs Flash v2.5 y supera a Fish Audio S2 Pro, Gradium API y Cartesia Sonic 3 en prosodia.
Los pesos del modelo se publican en Hugging Face bajo la Licencia del Modelo Comunitario Tontaube 1.0.