Исследователи представляют Visual Answerability Diagnosis with Rationales (VAD-R), новый бенчмарк, предназначенный для оценки способности моделей «зрение-язык» воздерживаться от ответов на вопросы, не имеющие ответа, без использования упрощающих подсказок. Исследование показывает, что, хотя скрытые состояния могут различать наличие ответа, текущие модели не способны перевести это в явные решения.
- VAD-R использует двухэтапный конвейер фильтрации упрощающих подсказок и проверки качества с пошаговыми обоснованиями.
- Современные открытые VLM демонстрируют ограниченное спонтанное воздержание со средним показателем полноты (recall) всего 11,4%.
- Авторы предлагают Rep2Act — метод выравнивания латентного осознания наличия ответа с явными действиями по отказу от ответа.
- Rep2Act повышает точность действий на VAD-R примерно с 56–59% до более чем 86–88% для моделей Qwen2.5-VL.
- На вневыборочном наборе данных TUBench Rep2Act достигает среднего показателя F1 равного 53,3%, превосходя GPT-4 Turbo и GPT-4o.
Этот подход устраняет разрыв между представлением и действием, позволяя VLM эффективно распознавать моменты, когда следует воздержаться от ответа на вопрос.