NemotronLabs telah memperkenalkan VoiceChat, model obrolan suara dua arah penuh dengan bobot terbuka yang dirancang untuk mengintegrasikan pendengaran, transkripsi, penalaran, dan pengucapan dalam satu arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel khusus untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi pengguna inkremental.

  • Pada Full-Duplex-Bench 1.0, model mencapai tingkat alih penanganan jeda terendah di antara sistem bobot terbuka yang dievaluasi, dengan alih 100% setelah interupsi pengguna dan skor kualitas respons pasca-interupsi sebesar 4.33/5.
  • Model melanjutkan respons setelah backchannel pengguna dalam 93% kasus pada Full-Duplex-Bench 1.5.
  • Model memperoleh rata-rata ternormalisasi 55.1 pada VoiceBench dan mencapai F1 pemilihan alat 82.5% pada Full-Duplex-Bench 3.0, meskipun akurasi argumen dan eksekusi alat end-to-end memerlukan peningkatan.

Hasil-hasil ini menunjukkan bahwa interaksi dua arah penuh, pengenalan dan generasi suara, kemampuan bahasa umum, dan penggunaan alat eksternal dapat diintegrasikan dalam satu model terbuka tanpa mengorbankan perilaku percakapan waktu nyata.