연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.
- M$^3$R-Bench는 증거 식별, 매핑 확립 및 감정 추론을 요구함으로써 교차 모달 추론에 대해 모델을 평가합니다.
- 평가 결과 기존 모델들은 시각적 증거를 종종 간과하고 피상적인 텍스트 단서에 의존하여 교차 모달 증거-매핑 불일치를 드러냈습니다.
- 이를 해결하기 위해 저자들은 교육 기반 추론 감독과 작업 인식 강화 학습을 결합한 M$^3$R-Reasoner를 제안합니다.
- 8B 파라미터의 M$^3$R-Reasoner는 더 큰 상용 MLLM들을 능가하며 GPT-5.5 대비 시각적 증거 및 감정 정당화 점수를 각각 28.45점과 30.11점 향상시킵니다.
이 벤치마크는 모델들이 시각적 및 텍스트적 단서에 기반한 매핑을 확립하는지 평가하는 난제성을 강조하며, 제안된 추론기는 은유 해석과의 개선된 정렬을 보여줍니다.