NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle de parole à parole de bout en bout ouvert de 11 milliards de paramètres conçu pour la conversation en temps réel et en duplex intégral. Contrairement aux piles en cascade qui enchaînent ASR, LLM et TTS, ce réseau unifié effectue simultanément la compréhension et la génération de flux audio, atteignant une latence mesurée de prise de tour fluide de 448 ms sur Full-Duplex-Bench 1.0.
- L'architecture combine un encodeur Fast Conformer, le socle LLM Nemotron Nano v2 et un décodeur TTS NVIDIA, entraîné sur environ 550k heures d'audio.
- Il prend en charge l'appel d'outils en direct via un canal de sortie séparé pour les scripts <TOOLCALL>, permettant aux opérateurs de définir des messages « en attente » pour éviter les silences morts pendant les appels API.
- Le modèle permet aux utilisateurs d'intervenir en cours de tour avec un taux de prise de contrôle de 1,00 à 480 ms, et se classe #2 parmi les modèles ouverts en duplex intégral sur VoiceBench.
- Les poids sont disponibles sous la licence permissive OpenMDW-1.1, mais NVIDIA qualifie le point de contrôle comme prêt uniquement pour des fins de recherche en raison de modes d'échec connus tels que les limites de plafond de contexte.
- Le déploiement nécessite un seul GPU avec au moins 80 Go de VRAM, tel qu'un A100 ou H100, et aucune API hébergée n'est actuellement fournie.
La publication offre une option déployable pour des pilotes dans les centres d'appels, les assistants automobiles et les outils d'accessibilité, bien qu'elle ne soit pas encore recommandée pour un usage en production.