Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.
- O VAD-R utiliza um pipeline de duas etapas de filtragem de atalhos e verificação de qualidade com raciocínios passo a passo.
- Os VLMs open-source de última geração mostram abstenção espontânea limitada, com taxas médias de recall de apenas 11,4%.
- Os autores propõem o Rep2Act, um método para alinhar a consciência latente de responsividade com ações explícitas de abstenção.
- O Rep2Act melhora a precisão da ação no VAD-R de aproximadamente 56-59% para mais de 86-88% nos modelos Qwen2.5-VL.
- No TUBench fora da distribuição, o Rep2Atinge uma pontuação média F1 de 53,3%, superando GPT-4 Turbo e GPT-4o.
Essa abordagem preenche a lacuna entre representação e ação, permitindo que os VLMs reconheçam efetivamente quando não devem responder a uma pergunta.