A NVIDIA disponibilizou o modelo de chat de voz NemotronLabs-VoiceChat-11B no Hugging Face. O repositório é descrito como suportando capacidades de comunicação full duplex.
NVIDIA lança modelo NemotronLabs-VoiceChat-11B no Hugging Face
NVIDIA lança modelo de diarização Nemotron 3 com pesos abertos
A NVIDIA lançou o Nemotron 3 Diarization, um modelo com pesos abertos e 100M de parâmetros para diarização de falantes em tempo real que suporta até oito falantes. O modelo ocupa a posição #1 no ranking Diarization-Bench da VoiceArena com uma Taxa de Erro de Diarização (DER) de 14,72%, superando o próximo sistema classificado em aproximadamente 24% de redução relativa.
NVIDIA Magpie TTS adiciona árabe, coreano e português e melhora a qualidade
A NVIDIA lançou uma atualização para seu modelo de TTS multilíngue Magpie, expandindo o suporte para doze idiomas com a adição de Árabe Padrão Moderno, coreano e português brasileiro. A versão também inclui melhorias de qualidade nos idiomas existentes por meio de dados de treinamento atualizados e alterações na arquitetura.
NVIDIA lança NemotronLabs VoiceChat 11B, um modelo de fala-para-fala full-duplex aberto com troca de turno em ~450 ms
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.
Nvidia lança LLM unificado de áudio e texto Nemotron-Labs-Audex-30B-A3B
A Nvidia lançou o Nemotron-Labs-Audex-30B-A3B, um grande modelo de linguagem unificado de áudio e texto construído sobre a base MoE Nemotron-Cascade-2-30B-A3B apenas para texto. O modelo estende a arquitetura original com um codificador de áudio para entradas e tokens de áudio discretos para saídas, habilitando capacidades em reconhecimento de fala, tradução, texto-para-fala e geração de áudio.
NemotronLabs lança VoiceChat, um modelo aberto de fala-para-fala full-duplex com chamada de ferramentas
A NemotronLabs apresentou o VoiceChat, um modelo open-weight de fala-para-fala full-duplex projetado para integrar escuta, transcrição, raciocínio e fala dentro de uma arquitetura de streaming unificada. O sistema combina um codificador de streaming de áudio e um modelo de linguagem decoder-only com fluxos de saída especializados paralelos para texto do agente e chamadas de função estruturadas, além de um ramo auxiliar RNN-T para transcrição incremental do usuário.