경량이고 설명 가능한 음성 활동 감지기인 NOVA-VAD는 UrbanSound8K 데이터세트의 노이즈 있는 오디오에서 93%의 정확도를 달성하여 WebRTC(58%), Pyannote(62%), Silero(87%)를 능가합니다. scikit-learn만 사용하며 GPU가 필요 없고, 평이한 영어로 기능 중요도와 신뢰 점수를 제공합니다.
NOVA-VAD, 노이즈 있는 오디오에서 93% 정확도로 Silero, Pyannote, WebRTC를 압도
NVIDIA Magpie TTS 아랍어, 한국어 추가 및 품질 개선
NVIDIA는 Magpie 다국어 TTS 모델의 업데이트를 출시하여 현대 표준 아랍어, 한국어, 브라질 포르투갈어를 추가해 총 12개 언어로 지원을 확대했습니다. 이번 릴리스는 업데이트된 학습 데이터와 아키텍처 변경을 통해 기존 언어 전반에 걸쳐 품질을 개선했습니다.
NVIDIA, ~450ms 턴테이킹을 지원하는 오픈 풀듀플렉스 음성-음성 모델 NemotronLabs VoiceChat 11B 출시
NVIDIA는 실시간 풀듀플렉스 대화를 위해 설계된 오픈 11B 파라미터 엔드투엔드 음성-음성 모델인 NemotronLabs VoiceChat 11B를 출시했습니다. ASR, LLM 및 TTS를 체이닝하는 캐스케이디드 스택과 달리, 이 통합 네트워크는 스트리밍 음성을 동시에 이해하고 생성하며, Full-Duplex-Bench 1.0에서 측정된 부드러운 턴테이킹 지연시간은 448ms입니다.
NVIDIA, Hugging Face에 NemotronLabs-VoiceChat-11B 모델 출시
NVIDIA가 Hugging Face에 NemotronLabs-VoiceChat-11B 음성 채팅 모델을 출시했습니다. 저장소는 풀 듀플렉스 통신 기능을 지원한다고 설명되어 있습니다.
Freya-TTS, 토크나이저 없는 터키어 TTS 모델 공개 (8.0% WER)
연구자들은 터키어에 최적화된 컴팩트한 토크나이저 없는 텍스트 음성 변환(TTS) 모델인 Freya-TTS를 소개했으며, Freya-TR-Eval 벤치마크에서 8.0%의 단어 오류율(WER)을 달성했습니다. 1억 8320만 파라미터의 비자기회귀 조건 흐름 매칭 Diffusion Transformer는 AudioVAE2의 고정된 연속 잠재 공간에서 작동하며, 음소 분할기나 이산 음성 토크나이저 없이 48 kHz 고품질 복원을 가능하게 합니다.
OpenMOSS, 공동 전사 및 화자 분리를 위한 MOSS-Transcribe-Diarize 0.9B 출시
OpenMOSS는 장편 다중 화자 전사, 화자 분리, 타임스탬프 및 음향 이벤트 인식을 위해 설계된 0.9B 파라미터 엔드투엔드 오디오 이해 모델인 MOSS-Transcribe-Diarize를 출시했습니다.