Los investigadores presentan Visual Answerability Diagnosis with Rationales (VAD-R), un nuevo benchmark diseñado para evaluar la capacidad de los modelos de visión y lenguaje de abstenerse de preguntas sin respuesta sin depender de atajos. El estudio revela que, aunque los estados ocultos pueden distinguir la capacidad de respuesta, los modelos actuales no logran traducir esto en decisiones explícitas.
- VAD-R utiliza una canalización de dos etapas de filtrado de atajos y verificación de calidad con razonamientos paso a paso.
- Los VLM de código abierto de última generación muestran una abstención espontánea limitada, con tasas de recall promedio de solo 11.4%.
- Los autores proponen Rep2Act, un método para alinear la conciencia latente de la capacidad de respuesta con acciones explícitas de abstención.
- Rep2Act mejora la precisión de la acción en VAD-R de aproximadamente 56-59% a más del 86-88% para los modelos Qwen2.5-VL.
- En el benchmark fuera de distribución TUBench, Rep2Act logra una puntuación F1 promedio de 53.3%, superando a GPT-4 Turbo y GPT-4o.
Este enfoque cierra la brecha entre la representación y la acción, permitiendo que los VLM reconozcan eficazmente cuándo no deberían responder a una pregunta.