研究人员推出了M$^3$R-Bench,这是一个统一的基准测试集,包含1,000个经过人工验证标注的图像-文本实例,旨在评估基于证据的多模态隐喻理解能力。该基准测试为隐喻出现、目标-源映射、情感以及基于概念隐喻理论的阶段性解释提供了联合标注。
- M$^3$R-Bench通过要求模型进行证据识别、建立映射和情感推断来评估跨模态推理能力。
- 评估结果显示,现有模型往往忽视视觉证据而依赖表面文本线索,暴露出跨模态证据与映射之间的不匹配问题。
- 为解决这一问题,作者提出了M$^3$R-Reasoner,该方法结合了基于课程的学习推理监督与任务感知的强化学习。
- 拥有80亿参数的M$^3$R-Reasoner优于更大的专有MLLMs,并在视觉证据和情感理由评分上分别比GPT-5.5高出28.45和30.11分。
该基准测试突显了评估模型是否建立基于视觉和文本线索的映射的难度,而所提出的推理器则展示了与隐喻解释更好的对齐能力。