Los investigadores presentan M$^3$R-Bench, un benchmark unificado que contiene 1.000 instancias de imagen-texto con anotaciones verificadas por humanos diseñadas para evaluar la comprensión de metáforas multimodales fundamentadas en evidencia. El benchmark proporciona anotaciones conjuntas para la ocurrencia de metáforas, el mapeo Objetivo-Fuente, el sentimiento y explicaciones por etapas basadas en la Teoría de las Metáforas Conceptuales.

  • M$^3$R-Bench evalúa a los modelos en el razonamiento entre modalidades al requerir la identificación de evidencia, el establecimiento de mapeos y la inferencia del sentimiento.
  • Las evaluaciones revelan que los modelos existentes suelen pasar por alto la evidencia visual y dependen de indicios textuales superficiales, exponiendo una falta de coincidencia en el mapeo de evidencia entre modalidades.
  • Para abordar esto, los autores proponen M$^3$R-Reasoner, que combina la supervisión del razonamiento basada en currículo con el aprendizaje por refuerzo consciente de la tarea.
  • El M$^3$R-Reasoner de 8B parámetros supera a MLLMs propietarios más grandes y mejora las puntuaciones de Justificación de Evidencia Visual y Sentimiento en 28,45 y 30,11 puntos respectivamente sobre GPT-5.5.

El benchmark destaca la dificultad de evaluar si los modelos establecen mapeos fundamentados en indicios visuales y textuales, mientras que el razonador propuesto demuestra una alineación mejorada con la interpretación de metáforas.