Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.
- M$^3$R-Bench оценивает модели в задачах кросс-модального рассуждения, требуя идентификации доказательств, установления отображений и вывода тональности.
- Оценки показывают, что существующие модели часто игнорируют визуальные доказательства и полагаются на поверхностные текстовые признаки, выявляя несоответствие между кросс-модальными доказательствами и отображениями.
- Чтобы решить эту проблему, авторы предлагают M$^3$R-Reasoner, который сочетает обучение рассуждению с программой (curriculum-based reasoning supervision) с усилением обучения, учитывающим специфику задачи (task-aware reinforcement learning).
- M$^3$R-Reasoner с 8 млрд параметров превосходит более крупные проприетарные MLLM и улучшает показатели обоснования визуальных доказательств и тональности по сравнению с GPT-5.5 на 28,45 и 30,11 балла соответственно.
Бенчмарк подчеркивает сложность оценки способности моделей устанавливать отображения, основанные на визуальных и текстовых признаках, а предложенный рассуждающий агент демонстрирует улучшенное соответствие интерпретации метафор.