NemotronLabs telah memperkenalkan NemotronLabs VoiceChat, sebuah model obrolan suara dua arah penuh dengan bobot terbuka yang mengintegrasikan kemampuan panggilan alat asli dalam arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi inkremental dan decoder TTS streaming.
- Mencapai tingkat alih penanganan jeda terendah di antara sistem bobot terbuka yang dievaluasi pada Full-Duplex-Bench 1.0, dengan alih 100% setelah interupsi pengguna dan skor kualitas respons pasca-interupsi 4,33/5.
- Melanjutkan respons setelah umpan balik pengguna dalam 93% kasus pada Full-Duplex-Bench 1.5.
- Mendapatkan rata-rata ternormalisasi 55,1 pada VoiceBench dan skor F1 pemilihan alat 82,5% pada Full-Duplex-Bench 3.0, meskipun akurasi argumen dan eksekusi alat end-to-end memerlukan perbaikan.
Model ini menunjukkan bahwa interaksi dua arah penuh, pengenalan dan generasi suara, kemampuan bahasa umum, dan penggunaan alat eksternal dapat diintegrasikan dalam satu model obrolan suara terbuka tanpa mengorbankan perilaku percakapan waktu nyata.