연구자들은 Visual Answerability Diagnosis with Rationales(VAD-R)이라는 새로운 벤치마크를 소개했으며, 이는 단서 없이 답할 수 없는 질문에 대해 기권하는 능력과 관련된 시각-언어 모델의 성능을 평가하기 위해 설계되었습니다. 연구 결과, 은닉 상태가 답변 가능성을 구분할 수는 있지만 현재 모델들은 이를 명시적인 결정으로 전환하지 못하는 것으로 드러났습니다.

  • VAD-R은 단계별 추론을 통한 단서 필터링 및 품질 검증이라는 두 단계 파이프라인을 사용합니다.
  • 최첨단 오픈소스 VLM들은 평균 재현율이 11.4%에 불과할 정도로 제한된 자발적 기권 능력을 보여줍니다.
  • 저자들은 잠재적 답변 가능성 인식을 명시적인 기권 행동과 정렬하는 방법인 Rep2Act를 제안합니다.
  • Rep2Act는 Qwen2.5-VL 모델에서 VAD-R의 행동 정확도를 약 56-59%에서 86-88% 이상으로 향상시킵니다.
  • 분포 밖 데이터셋인 TUBench에서 Rep2Act는 평균 F1 점수 53.3%를 달성하여 GPT-4 Turbo 및 GPT-4o를 능가합니다.

이 접근 방식은 표현과 행동 간의 격차를 해소하여 VLM이 질문을 답하지 말아야 할 시기를 효과적으로 인식할 수 있도록 합니다.