NOVA-VAD, un détecteur d'activité vocale léger et explicable, atteint une précision de 93 % sur l'audio bruyant du jeu de données UrbanSound8K, surpassant WebRTC (58 %), Pyannote (62 %) et Silero (87 %). Il utilise uniquement scikit-learn, ne nécessite pas de GPU et fournit l'importance des fonctionnalités et les scores de confiance en anglais simple.
NOVA-VAD bat Silero, Pyannote et WebRTC sur l'audio bruyant avec une précision de 93 %
NVIDIA Magpie TTS ajoute l'arabe, le coréen et le portugais, et améliore la qualité
NVIDIA a publié une mise à jour de son modèle Magpie Multilingual TTS, élargissant le support à douze langues avec l'ajout de l'arabe standard moderne, du coréen et du portugais brésilien. La publication inclut également des améliorations de qualité pour les langues existantes grâce à des données d'entraînement mises à jour et des modifications architecturales.
NVIDIA publie NemotronLabs VoiceChat 11B, un modèle de parole à parole en duplex intégral ouvert avec une prise de tour d'environ 450 ms
NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de parole à parole de bout en bout ouvert de 11 milliards de paramètres conçu pour la conversation en temps réel et en duplex intégral. Contrairement aux piles en cascade qui enchaînent ASR, LLM et TTS, ce réseau unifié effectue simultanément la compréhension et la génération de flux audio, atteignant une latence mesurée de prise de tour fluide de 448 ms sur Full-Duplex-Bench 1.0.
NVIDIA publie le modèle NemotronLabs-VoiceChat-11B sur Hugging Face
NVIDIA a rendu disponible le modèle de chat vocal NemotronLabs-VoiceChat-11B sur Hugging Face. Le dépôt est décrit comme prenant en charge les capacités de communication full duplex.
Freya-TTS publie un modèle TTS turc sans tokenizeur avec un WER de 8,0 %
Les chercheurs présentent Freya-TTS, un modèle de synthèse vocale (TTS) compact et sans tokenizeur, optimisé pour le turc, qui atteint un taux d'erreur de mots (WER) de 8,0 % sur le benchmark Freya-TR-Eval. Le Diffusion Transformer à appariement de flux conditionnel non-autoregressif de 183,2 millions de paramètres opère dans l'espace latent continu figé d'AudioVAE2, permettant une reconstruction haute qualité à 48 kHz sans phonémiseur ni tokenizeur de parole discret.
OpenMOSS lance MOSS-Transcribe-Diarize 0.9B pour la transcription et la diarisation conjointes
OpenMOSS a publié MOSS-Transcribe-Diarize, un modèle de compréhension audio de bout en bout de 0,9 milliard de paramètres conçu pour la transcription longue forme multi-intervenants, la diarisation, les horodatages et la détection d'événements acoustiques.