शोधकर्ताओं ने Visual Answerability Diagnosis with Rationales (VAD-R) का परिचय दिया, एक नया बेंचमार्क जो दृश्य-भाषा मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि वे शॉर्टकट संकेतों के बिना उत्तर देने योग्य नहीं होने वाले प्रश्नों से कैसे बचते हैं। अध्ययन से पता चलता है कि छिपी हुई अवस्थाएँ उत्तर देने की क्षमता को अलग कर सकती हैं, लेकिन वर्तमान मॉडल इसे स्पष्ट निर्णयों में परिवर्तित करने में विफल रहते हैं।

  • VAD-R चरण-दर-चरण तर्कों के साथ शॉर्टकट फ़िल्टरिंग और गुणवत्ता सत्यापन की एक दो-चरणीय पाइपलाइन का उपयोग करता है।
  • सर्वोत्तम प्रदर्शन करने वाले ओपन-सोर्स VLMs में स्वतः बचाव सीमित है, जिसमें औसत रिकॉल दर केवल 11.4% है।
  • लेखकों ने Rep2Act का प्रस्ताव दिया, एक विधि जो छिपी हुई उत्तर देने की क्षमता की जागरूकता को स्पष्ट बचाव कार्यों से संरेखित करती है।
  • Qwen2.5-VL मॉडलों के लिए VAD-R पर Rep2Act ने कार्य सटीकता को लगभग 56-59% से बढ़ाकर 86-88% से अधिक कर दिया।
  • आउट-ऑफ-डिस्ट्रीब्यूशन TUBench पर, Rep2Act ने 53.3% की औसत F1 स्कोर हासिल की, जो GPT-4 Turbo और GPT-4o को पार कर जाती है।

यह दृष्टिकोण निरूपण और कार्य के बीच अंतराल को पाटता है, VLMs को यह प्रभावी ढंग से पहचानने में सक्षम बनाता है कि उन्हें कब प्रश्न का उत्तर नहीं देना चाहिए।