Los investigadores presentan TontaubeV1, un modelo de texto-a-voz que preserva la prosodia natural mientras habilita inferencia en streaming desde una única GPU de consumo. El sistema utiliza una representación DualCodec jerárquica a 12.5 Hz para separar las secuencias semánticas de los refinamientos acústicos, permitiendo la decodificación causal a pesar de la naturaleza no causal del códec subyacente.
- La arquitectura emplea cuatro transformadores derivados de Qwen3 con un total de 2.9B parámetros: uno predice la secuencia semántica y la duración del enunciado, mientras que tres modelos progresivamente más pequeños añaden refinamientos acústicos.
- El texto se tokeniza por carácter, con marcadores de texto y audio emparejados que soportan la generación de larga duración mediante contexto acotado.
- En una única RTX 5090, la ruta en streaming logra aproximadamente 200 ms hasta el primer audio, con un factor de tiempo real extremo a extremo de 0.08 para una entrada.
- El modelo iguala a ElevenLabs Flash v2.5 y supera a Fish Audio S2 Pro, Gradium API y Cartesia Sonic 3 en prosodia en evaluaciones LLM-as-a-judge.
El lanzamiento proporciona una solución que equilibra alta calidad perceptual con baja latencia, haciéndolo adecuado para aplicaciones en tiempo real en hardware accesible.