NemotronLabs a présenté NemotronLabs VoiceChat, un modèle de parole à parole en duplex intégral à poids ouverts qui intègre des capacités natives d'appel d'outils au sein d'une architecture de streaming unifiée. Le système combine un encodeur de parole en streaming et un modèle de langage uniquement décodeur avec des flux de sortie parallèles pour le texte de l'agent et les appels de fonction structurés, ainsi qu'une branche RNN-T auxiliaire pour la transcription incrémentale et un décodeur TTS en streaming.

  • Atteint les taux de reprise de contrôle de pause les plus bas parmi les systèmes à poids ouverts évalués sur Full-Duplex-Bench 1.0, avec 100 % de reprise après les interruptions utilisateur et un score de qualité de réponse post-interruption de 4,33/5.
  • Reprend les réponses après les rétroactions utilisateur dans 93 % des cas sur Full-Duplex-Bench 1.5.
  • Obtient une moyenne normalisée de 55,1 sur VoiceBench et un score F1 de sélection d'outils de 82,5 % sur Full-Duplex-Bench 3.0, bien que la précision des arguments et l'exécution d'outils de bout en bout nécessitent des améliorations.

Le modèle démontre que l'interaction en duplex intégral, la reconnaissance et la génération de parole, les capacités linguistiques générales et l'utilisation d'outils externes peuvent être intégrées dans un seul modèle de parole à parole ouvert sans sacrifier le comportement conversationnel en temps réel.