NOVA-VAD, Detektor Aktivitas Suara yang ringan dan dapat dijelaskan, mencapai akurasi 93% pada audio berisik dari dataset UrbanSound8K, mengungguli WebRTC (58%), Pyannote (62%), dan Silero (87%). Ia hanya menggunakan scikit-learn, tidak memerlukan GPU, dan memberikan pentingnya fitur serta skor kepercayaan dalam bahasa Inggris sederhana.
NOVA-VAD mengalahkan Silero, Pyannote, dan WebRTC pada audio berisik dengan akurasi 93%
Magpie TTS NVIDIA menambahkan bahasa Arab, Korea, Portugis dan meningkatkan kualitas
NVIDIA telah merilis pembaruan untuk model Magpie Multilingual TTS-nya, memperluas dukungan ke dua belas bahasa dengan penambahan Bahasa Arab Standar Modern, Korea, dan Portugis Brasil. Rilis ini juga mencakup peningkatan kualitas di berbagai bahasa yang ada melalui pembaruan data pelatihan dan perubahan arsitektur.
NVIDIA merilis NemotronLabs VoiceChat 11B, model speech-to-speech full-duplex terbuka dengan pergantian giliran ~450 ms
NVIDIA telah merilis NemotronLabs VoiceChat 11B, model speech-to-speech end-to-end 11B parameter yang terbuka dan dirancang untuk percakapan real-time full-duplex. Tidak seperti tumpukan bertingkat yang merangkai ASR, LLM, dan TTS, jaringan terpadu ini melakukan pemahaman dan generasi suara secara streaming secara bersamaan, mencapai latensi pergantian giliran yang mulus sebesar 448 ms di Full-Duplex-Bench 1.0.
NVIDIA merilis model NemotronLabs-VoiceChat-11B di Hugging Face
NVIDIA telah membuat model obrolan suara NemotronLabs-VoiceChat-11B tersedia di Hugging Face. Repositori tersebut dideskripsikan mendukung kemampuan komunikasi full duplex.
Freya-TTS merilis model TTS Turki tanpa tokenizer dengan WER 8,0%
Para peneliti memperkenalkan Freya-TTS, model text-to-speech yang ringkas dan bebas tokenizer, dioptimalkan untuk bahasa Turki yang mencapai tingkat kesalahan kata (WER) 8,0% pada benchmark Freya-TR-Eval. Diffusion Transformer pencocokan aliran kondisional non-autoregresif dengan 183,2 juta parameter beroperasi di ruang laten kontinu AudioVAE2 yang dibekukan, memungkinkan rekonstruksi berkualitas tinggi 48 kHz tanpa fonemizer atau tokenizer ucapan diskrit.
OpenMOSS merilis MOSS-Transcribe-Diarize 0.9B untuk transkripsi dan diarization bersama
OpenMOSS telah merilis MOSS-Transcribe-Diarize, model pemahaman audio end-to-end dengan 0,9 miliar parameter yang dirancang untuk transkripsi multi-pembicara format panjang, diarization, timestamp, dan kesadaran peristiwa akustik.