Les chercheurs présentent M$^3$R-Bench, un benchmark unifié contenant 1 000 instances image-texte avec des annotations vérifiées par des humains, conçu pour évaluer la compréhension des métaphores multimodales ancrées dans les preuves. Le benchmark fournit des annotations conjointes pour l'occurrence de la métaphore, le mappage Cible-Source, le sentiment et des explications étape par étape basées sur la Théorie de la Métaphore Conceptuelle.
- M$^3$R-Bench évalue les modèles sur le raisonnement inter-modal en exigeant l'identification des preuves, l'établissement du mappage et l'inférence du sentiment.
- Les évaluations révèlent que les modèles existants négligent souvent les preuves visuelles et s'appuient sur des indices textuels superficiels, exposant un décalage dans le mappage des preuves inter-modales.
- Pour remédier à cela, les auteurs proposent M$^3$R-Reasoner, qui combine une supervision de raisonnement basée sur un curriculum avec l'apprentissage par renforcement conscient de la tâche.
- Le M$^3$R-Reasoner de 8 milliards de paramètres surpasse les grands MLLM propriétaires et améliore les scores de Justification des Preuves Visuelles et du Sentiment par rapport à GPT-5.5 de 28,45 et 30,11 points respectivement.
Le benchmark met en évidence la difficulté d'évaluer si les modèles établissent des mappages ancrés dans des indices visuels et textuels, tandis que le raisonneur proposé démontre une meilleure alignement avec l'interprétation des métaphores.