NVIDIA已在Hugging Face上发布了NemotronLabs-VoiceChat-11B语音聊天模型。该仓库被描述为支持全双工通信能力。
media
r/LocalLLaMA
·
51 天前
·
open_models
NVIDIA在Hugging Face上发布NemotronLabs-VoiceChat-11B模型
译自 English → 中文
相关文章
lab
Hugging Face Blog
·
刚刚
实时
NVIDIA 发布开源权重 Nemotron 3 说话人分离模型
NVIDIA 发布了 Nemotron 3 Diarization,这是一款用于实时说话人分离的开源权重、100M 参数模型,支持多达八位说话人。该模型在 VoiceArena 的 Diarization-Bench 排行榜上排名第一,说话人错误率(DER)为 14.72%,比排名第二的系统相对降低了约 24%。
lab
Hugging Face Blog
·
44 天前
·
18 次浏览
NVIDIA Magpie TTS 新增阿拉伯语、韩语和葡萄牙语,并提升质量
NVIDIA 已对其 Magpie Multilingual TTS 模型发布更新,通过新增现代标准阿拉伯语、韩语和巴西葡萄牙语,将支持语言扩展至十二种。此次发布还通过更新训练数据和架构变更,提升了现有语言的质量。
media
MarkTechPost
·
45 天前
·
57 次浏览
NVIDIA发布NemotronLabs VoiceChat 11B,一款开源全双工语音转语音模型,切换延迟约450毫秒
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款面向实时全双工对话的开源11B参数端到端语音转语音模型。与串联ASR、LLM和TTS的级联堆栈不同,该统一网络同时执行流式语音理解和生成,在Full-Duplex-Bench 1.0上测得的平滑切换延迟为448毫秒。
media
r/LocalLLaMA
·
78 天前
·
19 次浏览
Nvidia发布Nemotron-Labs-Audex-30B-A3B统一音频-文本大语言模型
Nvidia发布了Nemotron-Labs-Audex-30B-A3B,这是一个基于Nemotron-Cascade-2-30B-A3B纯文本MoE主干构建的统一音频-文本大语言模型。该模型在原始架构基础上增加了用于输入的音频编码器和用于输出的离散音频令牌,从而具备语音识别、翻译、文本转语音和音频生成的能力。
arxiv
arXiv cs.CL
·
2 天前
·
14 次浏览
NemotronLabs 发布 VoiceChat,一款支持工具调用的开源全双工语音到语音模型
NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。