NOVA-VAD是一种轻量级且可解释的语音活动检测器,在UrbanSound8K数据集的嘈杂音频上达到93%的准确率,优于WebRTC(58%)、Pyannote(62%)和Silero(87%)。它仅使用scikit-learn,无需GPU,并提供纯英文的特征重要性和置信度分数。
media
Hugging Face Forums
·
55 天前
·
open_models
NOVA-VAD在嘈杂音频上以93%的准确率击败Silero、Pyannote和WebRTC
译自 English → 中文
相关文章
lab
Hugging Face Blog
·
6 天前
·
21 次浏览
NVIDIA Magpie TTS 新增阿拉伯语、韩语和葡萄牙语,并提升质量
NVIDIA 已对其 Magpie Multilingual TTS 模型发布更新,通过新增现代标准阿拉伯语、韩语和巴西葡萄牙语,将支持语言扩展至十二种。此次发布还通过更新训练数据和架构变更,提升了现有语言的质量。
media
MarkTechPost
·
7 天前
·
24 次浏览
NVIDIA发布NemotronLabs VoiceChat 11B,一款开源全双工语音转语音模型,切换延迟约450毫秒
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。
media
r/LocalLLaMA
·
13 天前
·
8 次浏览
NVIDIA在Hugging Face上发布NemotronLabs-VoiceChat-11B模型
NVIDIA已在Hugging Face上发布了NemotronLabs-VoiceChat-11B语音聊天模型。该仓库被描述为支持全双工通信能力。
arxiv
arXiv cs.CL
·
35 天前
·
2 次浏览
Freya-TTS 发布无分词器土耳其语音合成模型,WER 为 8.0%
研究人员推出了 Freya-TTS,这是一种紧凑的、无需分词器的文本转语音模型,针对土耳其语进行了优化,在 Freya-TR-Eval 基准测试中实现了 8.0% 的词错误率(WER)。该拥有 1.832 亿参数的非自回归条件流匹配 Diffusion Transformer 在 AudioVAE2 的冻结连续潜在空间中运行,无需音素化器或离散语音分词器即可实现高质量的 48 kHz 重建。
media
r/LocalLLaMA
·
38 天前
OpenMOSS 发布 MOSS-Transcribe-Diarize 0.9B,用于联合转录与说话人日志
OpenMOSS 发布了 MOSS-Transcribe-Diarize,这是一个拥有 0.9B 参数的端到端音频理解模型,专为长篇幅多说话人转录、说话人日志、时间戳和声学事件感知而设计。