يقدم الباحثون تشخيص إمكانية الإجابة البصري مع المبررات (VAD-R)، وهو معيار جديد صُمّم لتقييم قدرة نماذج الرؤية واللغة على الامتناع عن الإجابة عن الأسئلة التي لا يمكن الإجابة عليها دون الاعتماد على إشارات مختصرة. تكشف الدراسة أنه بينما يمكن للحالات المخفية التمييز بين إمكانية الإجابة، تفشل النماذج الحالية في ترجمة ذلك إلى قرارات صريحة.

  • يستخدم VAD-R خط أنابيب من مرحلتين يتضمن تصفية الإشارات المختصرة والتحقق من الجودة مع مبررات خطوة بخطوة.
  • تُظهر أحدث نماذج الرؤية واللغة مفتوحة المصدر امتناعاً تلقائياً محدوداً، بمعدلات استدراج متوسطة لا تتجاوز 11.4% فقط.
  • يقترح المؤلفون طريقة Rep2Act لمطابقة الوعي المخفي بإمكانية الإجابة مع أفعال الامتناع الصريحة.
  • تحسّن Rep2Act دقة الفعل على VAD-R من حوالي 56-59% إلى أكثر من 86-88% لنماذج Qwen2.5-VL.
  • على مجموعة الاختبار خارج التوزيع TUBench، حققت Rep2Act متوسط درجة F1 تبلغ 53.3%, متفوقةً على GPT-4 Turbo وGPT-4o.

تسد هذه النهج الفجوة بين التمثيل والفعل، مما يمكّن نماذج الرؤية واللغة من التعرف بفعالية على الوقت الذي يجب فيها الامتناع عن الإجابة عن سؤال.