来源 · arXiv cs.CL
arxiv arXiv cs.CL · 2 天前 · 1 次浏览

Rep2Act对齐VLM表示以在新VAD-R基准上提升拒答能力

研究人员引入了带有理由的视觉可答性诊断(Visual Answerability Diagnosis with Rationales,VAD-R),这是一个新基准,旨在评估视觉-语言模型在不依赖捷径线索的情况下拒绝回答不可回答问题(unanswerable questions)的能力。研究表明,虽然隐藏状态能够区分问题的可答性,但当前模型未能将这种能力转化为明确的决策。

arxiv arXiv cs.CL · 10 天前 · 17 次浏览

NemotronLabs 发布 VoiceChat,一款支持工具调用的开源全双工语音到语音模型

NemotronLabs 推出了 VoiceChat,这是一款开源权重的全双工语音到语音模型,旨在通过统一的流式架构整合监听、转录、推理和说话功能。该系统将流式语音编码器与仅解码器的语言模型相结合,并为智能体文本和结构化函数调用提供并行专用输出流,同时辅以用于增量用户转录的 RNN-T 分支。