NVIDIA a rendu disponible le modèle de chat vocal NemotronLabs-VoiceChat-11B sur Hugging Face. Le dépôt est décrit comme prenant en charge les capacités de communication full duplex.
NVIDIA publie le modèle NemotronLabs-VoiceChat-11B sur Hugging Face
NVIDIA publie le modèle Nemotron 3 Diarization à poids ouverts
NVIDIA a publié Nemotron 3 Diarization, un modèle à poids ouverts de 100 millions de paramètres pour la diarisation des locuteurs en temps réel, prenant en charge jusqu'à huit locuteurs. Le modèle se classe #1 sur le classement VoiceArena's Diarization-Bench avec un taux d'erreur de diarisation (DER) de 14,72 %, surpassant le système suivant d'une réduction relative d'environ 24 %.
NVIDIA Magpie TTS ajoute l'arabe, le coréen et le portugais, et améliore la qualité
NVIDIA a publié une mise à jour de son modèle Magpie Multilingual TTS, élargissant le support à douze langues avec l'ajout de l'arabe standard moderne, du coréen et du portugais brésilien. La publication inclut également des améliorations de qualité pour les langues existantes grâce à des données d'entraînement mises à jour et des modifications architecturales.
NVIDIA publie NemotronLabs VoiceChat 11B, un modèle de parole à parole en duplex intégral ouvert avec une prise de tour d'environ 450 ms
NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de parole à parole de bout en bout ouvert de 11 milliards de paramètres conçu pour la conversation en temps réel et en duplex intégral. Contrairement aux piles en cascade qui enchaînent ASR, LLM et TTS, ce réseau unifié effectue simultanément la compréhension et la génération de flux audio, atteignant une latence mesurée de prise de tour fluide de 448 ms sur Full-Duplex-Bench 1.0.
Nvidia lance le LLM unifié audio-texte Nemotron-Labs-Audex-30B-A3B
Nvidia a publié Nemotron-Labs-Audex-30B-A3B, un grand modèle de langage unifié audio-texte construit sur la colonne vertébrale MoE uniquement textuelle Nemotron-Cascade-2-30B-A3B. Le modèle étend l'architecture originale avec un encodeur audio pour les entrées et des tokens audio discrets pour les sorties, permettant des capacités en reconnaissance vocale, traduction, synthèse vocale (text-to-speech) et génération audio.
NemotronLabs publie VoiceChat, un modèle de parole en parole plein duplex ouvert avec appel d'outils
NemotronLabs a présenté VoiceChat, un modèle poids ouverts de parole en parole plein duplex conçu pour intégrer l'écoute, la transcription, le raisonnement et la parole au sein d'une architecture de streaming unifiée. Le système combine un encodeur de flux audio et un décodeur de modèle de langage avec des flux de sortie spécialisés parallèles pour le texte agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale de l'utilisateur.