A NemotronLabs apresentou o VoiceChat, um modelo open-weight de fala-para-fala full-duplex projetado para integrar escuta, transcrição, raciocínio e fala dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de streaming de áudio e um modelo de linguagem decoder-only com fluxos de saída especializados paralelos para texto do agente e chamadas de função estruturadas, além de um ramo auxiliar RNN-T para transcrição incremental do usuário.
- No Full-Duplex-Bench 1.0, o modelo alcança as menores taxas de retomada de controle ao lidar com pausas entre os sistemas open-weight avaliados, com 100% de retomada após interrupções do usuário e uma pontuação de qualidade de resposta pós-interrupção de 4,33/5.
- Ele retoma as respostas após os backchannels do usuário em 93% dos casos no Full-Duplex-Bench 1.5.
- O modelo obtém uma média normalizada de 55,1 no VoiceBench e alcança F1 de seleção de ferramentas de 82,5% no Full-Duplex-Bench 3.0, embora a precisão dos argumentos e a execução de ferramentas de ponta a ponta necessitem de melhorias.
Esses resultados demonstram que a interação full-duplex, o reconhecimento e a geração de fala, as capacidades gerais de linguagem e o uso de ferramentas externas podem ser integrados em um único modelo aberto sem comprometer o comportamento conversacional em tempo real.