Para peneliti memperkenalkan Visual Answerability Diagnosis with Rationales (VAD-R), sebuah benchmark baru yang dirancang untuk mengevaluasi kemampuan model visi-bahasa dalam abstensi dari pertanyaan yang tidak dapat dijawab tanpa petunjuk pintasan. Studi ini mengungkapkan bahwa meskipun keadaan tersembunyi dapat membedakan keterjawaban, model saat ini gagal menerjemahkan hal ini menjadi keputusan eksplisit.

  • VAD-R menggunakan pipa dua tahap berupa penyaringan pintasan dan verifikasi kualitas dengan rasional langkah demi langkah.
  • Model VLM sumber terbuka terkini menunjukkan abstensi spontan yang terbatas dengan tingkat recall rata-rata hanya 11,4%.
  • Para penulis mengusulkan Rep2Act, sebuah metode untuk menyelaraskan kesadaran keterjawaban laten dengan tindakan abstensi eksplisit.
  • Rep2Act meningkatkan akurasi tindakan pada VAD-R dari sekitar 56-59% menjadi lebih dari 86-88% untuk model Qwen2.5-VL.
  • Pada TUBench out-of-distribution, Rep2Act mencapai skor F1 rata-rata 53,3%, melampaui GPT-4 Turbo dan GPT-4o.

Pendekatan ini menjembatani kesenjangan antara representasi dan tindakan, memungkinkan VLM secara efektif mengenali kapan mereka seharusnya tidak menjawab sebuah pertanyaan.