研究人员引入了带有理由的视觉可答性诊断(Visual Answerability Diagnosis with Rationales,VAD-R),这是一个新基准,旨在评估视觉-语言模型在不依赖捷径线索的情况下拒绝回答不可回答问题(unanswerable questions)的能力。研究表明,虽然隐藏状态能够区分问题的可答性,但当前模型未能将这种能力转化为明确的决策。

  • VAD-R采用两阶段流水线,包括捷径过滤和带有逐步理由的质量验证。
  • 最先进的开源VLM在自发拒答方面表现有限,平均召回率仅为11.4%。
  • 作者提出了Rep2Act,一种将对潜在可答性意识与显式拒答动作对齐的方法。
  • Rep2Act将Qwen2.5-VL模型在VAD-R上的动作准确率从约56-59%提升至86-88%以上。
  • 在分布外(out-of-distribution)的TUBench上,Rep2Act取得了53.3%的平均F1分数,超越了GPT-4 Turbo和GPT-4o。

该方法弥合了表示与动作之间的差距,使VLM能够有效识别何时不应回答问题。