Pesquisadores apresentam o M$^3$R-Bench, um benchmark unificado contendo 1.000 instâncias de imagem-texto com anotações verificadas por humanos, projetado para avaliar a compreensão fundamentada em evidências de metáforas multimodais. O benchmark fornece anotações conjuntas para ocorrência de metáfora, mapeamento Alvo-Fonte, sentimento e explicações etapa a etapa baseadas na Teoria da Metáfora Conceitual.

  • O M$^3$R-Bench avalia modelos em raciocínio cross-modal ao exigir identificação de evidências, estabelecimento de mapeamentos e inferência de sentimento.
  • As avaliações revelam que modelos existentes frequentemente ignoram evidências visuais e dependem de indícios textuais superficiais, expondo uma inconsistência no mapeamento de evidências cross-modais.
  • Para abordar isso, os autores propõem o M$^3$R-Reasoner, que combina supervisão de raciocínio baseada em currículo com aprendizado por reforço consciente da tarefa.
  • O M$^3$R-Reasoner de 8B parâmetros supera MLLMs proprietários maiores e melhora as pontuações de Justificativa de Evidência Visual e Sentimento em relação ao GPT-5.5 em 28,45 e 30,11 pontos, respectivamente.

O benchmark destaca a dificuldade de avaliar se os modelos estabelecem mapeamentos fundamentados em indícios visuais e textuais, enquanto o reasoner proposto demonstra alinhamento aprimorado com a interpretação de metáforas.