主题 · Evaluation & benchmarks
arxiv arXiv cs.CL · 2 天前 · 1 次浏览

Rep2Act对齐VLM表示以在新VAD-R基准上提升拒答能力

研究人员引入了带有理由的视觉可答性诊断(Visual Answerability Diagnosis with Rationales,VAD-R),这是一个新基准,旨在评估视觉-语言模型在不依赖捷径线索的情况下拒绝回答不可回答问题(unanswerable questions)的能力。研究表明,虽然隐藏状态能够区分问题的可答性,但当前模型未能将这种能力转化为明确的决策。

media Hugging Face Forums · 4 天前 · 7 次浏览

社区对Jev的效率主张和技术新颖性的怀疑

文章讨论了LinkedIn上对“Jev”的兴趣激增,尽管作者发现几乎没有实质性证据支持这些说法,但Jev仍被吹捧为人工智能领域的革命性突破。作者指出,虽然Jev宣传了巨大的效率和一种新范式,但它缺乏评估数据和技术细节,引发了关于它是否代表真正的架构创新还是仅仅是重新包装的分类的疑问。