O NOVA-VAD, um detector de atividade de voz leve e explicável, alcança 93% de precisão em áudio ruidoso do conjunto de dados UrbanSound8K, superando o WebRTC (58%), Pyannote (62%) e Silero (87%). Ele usa apenas scikit-learn, não requer GPU e fornece importância de recursos e pontuações de confiança em inglês simples.
NOVA-VAD supera Silero, Pyannote e WebRTC em áudio ruidoso com 93% de precisão
NVIDIA Magpie TTS adiciona árabe, coreano e português e melhora a qualidade
A NVIDIA lançou uma atualização para seu modelo de TTS multilíngue Magpie, expandindo o suporte para doze idiomas com a adição de Árabe Padrão Moderno, coreano e português brasileiro. A versão também inclui melhorias de qualidade nos idiomas existentes por meio de dados de treinamento atualizados e alterações na arquitetura.
NVIDIA lança NemotronLabs VoiceChat 11B, um modelo de fala-para-fala full-duplex aberto com troca de turno em ~450 ms
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de ponta a ponta de fala-para-fala aberto com 11B de parâmetros, projetado para conversação full-duplex em tempo real. Diferente das pilhas em cascata que encadeiam ASR, LLM e TTS, esta rede unificada realiza compreensão e geração de streaming de fala simultaneamente, alcançando uma latência medida de troca de turno suave de 448 ms no Full-Duplex-Bench 1.0.
NVIDIA lança modelo NemotronLabs-VoiceChat-11B no Hugging Face
A NVIDIA disponibilizou o modelo de chat de voz NemotronLabs-VoiceChat-11B no Hugging Face. O repositório é descrito como suportando capacidades de comunicação full duplex.
Freya-TTS lança modelo de TTS turco sem tokenizador com WER de 8,0%
Pesquisadores apresentam o Freya-TTS, um modelo compacto de texto para fala sem tokenizador otimizado para turco que alcança uma taxa de erro de palavras (WER) de 8,0% no benchmark Freya-TR-Eval. O Diffusion Transformer condicional não autoregressivo com 183,2 milhões de parâmetros, baseado em matched flow, opera no espaço latente contínuo congelado do AudioVAE2, permitindo reconstrução de alta qualidade a 48 kHz sem fonemizador ou tokenizador de fala discreto.
OpenMOSS lança MOSS-Transcribe-Diarize 0.9B para transcrição e diarização conjuntas
A OpenMOSS lançou o MOSS-Transcribe-Diarize, um modelo de compreensão de áudio de ponta a ponta com 0.9B de parâmetros, projetado para transcrição longa de múltiplos falantes, diarização, timestamps e consciência de eventos acústicos.