NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.
- Arsitekturnya menggabungkan encoder Fast Conformer, backbone LLM Nemotron Nano v2, dan decoder TTS NVIDIA, yang dilatih pada sekitar 550k jam audio.
- Model ini mendukung pemanggilan alat secara langsung melalui saluran output terpisah untuk skrip <TOOLCALL>, memungkinkan operator mendefinisikan pesan "menunggu" untuk mencegah keheningan selama panggilan API.
- Model ini memungkinkan pengguna untuk menyela di tengah giliran dengan tingkat pengambilan alih 1.00 pada 480 ms, dan menempati peringkat #2 di antara model full-duplex terbuka di VoiceBench.
- Bobot tersedia di bawah lisensi OpenMDW-1.1 yang permisif, namun NVIDIA menandai checkpoint tersebut hanya siap untuk tujuan penelitian karena adanya mode kegagalan yang diketahui seperti batas konteks.
- Penyiapan memerlukan satu GPU dengan VRAM minimal 80 GB, seperti A100 atau H100, dan saat ini tidak disediakan API terhosting.
Rilis ini menyediakan opsi yang dapat diimplementasikan untuk uji coba di pusat kontak, asisten otomotif, dan alat aksesibilitas, meskipun belum direkomendasikan untuk penggunaan produksi.