NVIDIA telah membuat model obrolan suara NemotronLabs-VoiceChat-11B tersedia di Hugging Face. Repositori tersebut dideskripsikan mendukung kemampuan komunikasi full duplex.
NVIDIA merilis model NemotronLabs-VoiceChat-11B di Hugging Face
NVIDIA merilis model penandaan pembicara Nemotron 3 Diarization berbobot terbuka
NVIDIA telah merilis Nemotron 3 Diarization, sebuah model berbobot terbuka dengan 100 juta parameter untuk penandaan pembicara secara real-time yang mendukung hingga delapan pembicara. Model ini menempati peringkat #1 di papan peringkat Diarization-Bench VoiceArena dengan Tingkat Kesalahan Penandaan (DER) sebesar 14,72%, mengungguli sistem berikutnya dengan pengurangan relatif sekitar 24%.
Magpie TTS NVIDIA menambahkan bahasa Arab, Korea, Portugis dan meningkatkan kualitas
NVIDIA telah merilis pembaruan untuk model Magpie Multilingual TTS-nya, memperluas dukungan ke dua belas bahasa dengan penambahan Bahasa Arab Standar Modern, Korea, dan Portugis Brasil. Rilis ini juga mencakup peningkatan kualitas di berbagai bahasa yang ada melalui pembaruan data pelatihan dan perubahan arsitektur.
NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech full-duplex terbuka dengan pergantian giliran ~450 ms
NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.
Nvidia merilis LLM audio-teks terpadu Nemotron-Labs-Audex-30B-A3B
Nvidia telah merilis Nemotron-Labs-Audex-30B-A3B, model bahasa besar terpadu audio-teks yang dibangun di atas tulang punggung MoE hanya teks Nemotron-Cascade-2-30B-A3B. Model ini memperluas arsitektur asli dengan encoder audio untuk input dan token audio diskrit untuk output, memungkinkan kemampuan dalam pengenalan suara, terjemahan, teks-ke-suara, dan generasi audio.
NemotronLabs merilis VoiceChat, model obrolan suara dua arah penuh dengan panggilan alat
NemotronLabs telah memperkenalkan VoiceChat, model obrolan suara dua arah penuh dengan bobot terbuka yang dirancang untuk mengintegrasikan pendengaran, transkripsi, penalaran, dan pengucapan dalam satu arsitektur streaming terpadu. Sistem ini menggabungkan encoder suara streaming dan model bahasa decoder-only dengan aliran output paralel khusus untuk teks agen dan panggilan fungsi terstruktur, serta cabang RNN-T tambahan untuk transkripsi pengguna inkremental.