Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.

  • O VAD-R utiliza um pipeline de duas etapas de filtragem de atalhos e verificação de qualidade com raciocínios passo a passo.
  • Os VLMs open-source de última geração mostram abstenção espontânea limitada, com taxas médias de recall de apenas 11,4%.
  • Os autores propõem o Rep2Act, um método para alinhar a consciência latente de responsividade com ações explícitas de abstenção.
  • O Rep2Act melhora a precisão da ação no VAD-R de aproximadamente 56-59% para mais de 86-88% nos modelos Qwen2.5-VL.
  • No TUBench fora da distribuição, o Rep2Atinge uma pontuação média F1 de 53,3%, superando GPT-4 Turbo e GPT-4o.

Essa abordagem preenche a lacuna entre representação e ação, permitindo que os VLMs reconheçam efetivamente quando não devem responder a uma pergunta.