NemotronLabs a présenté VoiceChat, un modèle poids ouverts de parole en parole plein duplex conçu pour intégrer l'écoute, la transcription, le raisonnement et la parole au sein d'une architecture de streaming unifiée. Le système combine un encodeur de flux audio et un décodeur de modèle de langage avec des flux de sortie spécialisés parallèles pour le texte agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale de l'utilisateur.
- Sur Full-Duplex-Bench 1.0, le modèle atteint les taux de reprise de contrôle de pause les plus bas parmi les systèmes à poids ouverts évalués, avec 100 % de reprise après les interruptions utilisateur et un score de qualité de réponse post-interruption de 4,33/5.
- Il reprend ses réponses après les rétroactions utilisateur dans 93 % des cas sur Full-Duplex-Bench 1.5.
- Le modèle obtient une moyenne normalisée de 55,1 sur VoiceBench et atteint un F1 de sélection d'outils de 82,5 % sur Full-Duplex-Bench 3.0, bien que la précision des arguments et l'exécution d'outils de bout en bout nécessitent des améliorations.
Ces résultats démontrent que l'interaction plein duplex, la reconnaissance et la génération de parole, les capacités linguistiques générales et l'utilisation d'outils externes peuvent être intégrées dans un seul modèle ouvert sans sacrifier le comportement conversationnel en temps réel.