研究者たちは、Vision Answerability Diagnosis with Rationales (VAD-R) を導入した。これは、ショートカットの手がかりなしに答えられない質問に対して回答を控えるビジョン言語モデルの能力を評価するために設計された新しいベンチマークである。本研究は、隠れ状態が回答可能性を区別できる一方で、現在のモデルはこの情報を明示的な意思決定に変換できないことを明らかにした。

  • VAD-Rは、ショートカットフィルタリングとステップバイステップの根拠を用いた品質検証という2段階のパイプラインを使用する。
  • 最先端のオープンソースVLMは限定的な自発的 abstention を示し、平均再現率はわずか11.4%にとどまる。
  • 著者らは、潜在する回答可能性の認識を明示的な abstention アクションと整合させる手法であるRep2Actを提案する。
  • Rep2Actは、Qwen2.5-VLモデルにおいてVAD-R上のアクション精度を約56-59%から86-88%以上に向上させる。
  • 分布外データセットのTUBenchでは、Rep2Actは平均F1スコア53.3%を達成し、GPT-4 TurboやGPT-4oを上回る。

このアプローチは表現とアクションのギャップを埋め、VLMが質問に答えるべきでないタイミングを効果的に認識できるようにする。