A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.

  • A arquitetura combina um codificador Fast Conformer, a base do LLM Nemotron Nano v2 e um decodificador TTS da NVIDIA, treinado em aproximadamente 550k horas de áudio.
  • Ele suporta chamada de ferramentas ao vivo por meio de um canal de saída separado para scripts <TOOLCALL>, permitindo que operadores definam mensagens de "aguardo" para evitar silêncio morto durante chamadas de API.
  • O modelo permite que os usuários interrompam a fala no meio do turno, com uma taxa de tomada de controle de 1.00 em 480 ms, e ocupa a posição #2 entre modelos full-duplex abertos no VoiceBench.
  • Os pesos estão disponíveis sob a licença permissiva OpenMDW-1.1, mas a NVIDIA rotula o checkpoint como pronto apenas para fins de pesquisa devido a modos de falha conhecidos, como limites de teto de contexto.
  • A implantação requer uma única GPU com pelo menos 80 GB de VRAM, como uma A100 ou H100, e nenhuma API hospedada está atualmente disponível.

O lançamento oferece uma opção implantável para pilotos em call centers, assistentes automotivos e ferramentas de acessibilidade, embora ainda não seja recomendado para uso em produção.