Para peneliti menyajikan TontaubeV1, sebuah model teks-ke-suara yang mempertahankan prosodi alami sambil memungkinkan inferensi streaming dari satu GPU konsumen. Sistem ini menggunakan representasi Hierarki DualCodec pada 12.5 Hz untuk memisahkan aliran semantik dari penyempurnaan akustik, sehingga memungkinkan generasi dengan latensi rendah.

  • Teks ditokenisasi per karakter dan diproses oleh transformer yang berasal dari Qwen3 untuk memprediksi durasi ucapan.
  • Tiga transformer yang semakin kecil menambahkan penyempurnaan akustik, total 2.9B parameter.
  • Rekonstruksi DualCodec yang tumpang tindih dipetakan ke ruang laten VibeVoice untuk dekode kausal.
  • Model ini menerima hingga satu menit audio referensi dan mendukung input bahasa Inggris, Jerman, dan multibahasa.
  • Pada satu RTX 5090, jalur streaming mencapai sekitar 200 ms ke audio pertama dengan RTF end-to-end sebesar 0.08.
  • TontaubeV1 menyamai ElevenLabs Flash v2.5 dan mengungguli Fish Audio S2 Pro, Gradium API, serta Cartesia Sonic 3 dalam hal prosodi.

Bobot model dirilis di Hugging Face di bawah Lisensi Model Komunitas Tontaube 1.0.