A NemotronLabs apresentou o NemotronLabs VoiceChat, um modelo de fala-para-fala full-duplex de pesos abertos que integra capacidades nativas de chamada de ferramentas dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de áudio em streaming e um modelo de linguagem decoder-only com fluxos de saída paralelos para texto do agente e chamadas de função estruturadas, além de um ramo RNN-T auxiliar para transcrição incremental e um decodificador TTS em streaming.

  • Alcança as menores taxas de retomada de controle no tratamento de pausas entre os sistemas de pesos abertos avaliados no Full-Duplex-Bench 1.0, com 100% de retomada após interrupções do usuário e uma pontuação de qualidade de resposta pós-interrupção de 4,33/5.
  • Retoma as respostas após os backchannels do usuário em 93% dos casos no Full-Duplex-Bench 1.5.
  • Obtém uma média normalizada de 55,1 no VoiceBench e uma pontuação F1 de seleção de ferramentas de 82,5% no Full-Duplex-Bench 3.0, embora a precisão dos argumentos e a execução de ferramentas de ponta a ponta necessitem de melhorias.

O modelo demonstra que a interação full-duplex, o reconhecimento e a geração de fala, as capacidades gerais de linguagem e o uso de ferramentas externas podem ser integrados em um único modelo de fala-para-fala aberto sem comprometer o comportamento conversacional em tempo real.