Les chercheurs présentent Visual Answerability Diagnosis with Rationales (VAD-R), un nouveau benchmark conçu pour évaluer la capacité des modèles vision-langage à s'abstenir de répondre aux questions sans réponse, sans se fier à des indices de raccourci. L'étude révèle que si les états cachés peuvent distinguer l'accessibilité de la réponse, les modèles actuels échuent à traduire cela en décisions explicites.

  • VAD-R utilise un pipeline en deux étapes de filtrage des raccourcis et de vérification de la qualité avec des rationnels étape par étape.
  • Les VLM open-source de pointe montrent une abstention spontanée limitée, avec des taux de rappel moyens de seulement 11,4 %.
  • Les auteurs proposent Rep2Act, une méthode pour aligner la conscience latente de l'accessibilité de la réponse avec des actions d'abstention explicites.
  • Rep2Act améliore la précision de l'action sur VAD-R, passant d'environ 56-59 % à plus de 86-88 % pour les modèles Qwen2.5-VL.
  • Sur le benchmark hors distribution TUBench, Rep2Act atteint un score F1 moyen de 53,3 %, surpassant GPT-4 Turbo et GPT-4o.

Cette approche comble l'écart entre la représentation et l'action, permettant aux VLM de reconnaître efficacement quand ils ne devraient pas répondre à une question.