يقدم الباحثون M$^3$R-Bench، وهو معيار موحد يحتوي على 1,000 حالة من الصور والنصوص معannotations تم التحقق منها بشريًا مصممة لتقييم فهم الاستعارات متعددة الوسائط المدعوم بالأدلة. يوفر المعيار annotations مشتركة لحدوث الاستعارة، والربط بين الهدف والمصدر، والمشاعر، وشرح خطوة بخطوة بناءً على نظرية الاستعارة المفاهيمية.

  • يقيم M$^3$R-Bench النماذج في الاستدلال عبر الوسائط من خلال تحديد الأدلة، وإنشاء الربط، واستنتاج المشاعر.
  • تكشف التقييمات أن النماذج الحالية غالبًا ما تتجاهل الأدلة البصرية وتعتمد على إشارات نصية سطحية، مما يكشف عن عدم تطابق في ربط الأدلة عبر الوسائط.
  • لمعالجة هذه المشكلة، يقترح المؤلفون M$^3$R-Reasoner، الذي يجمع بين الإشراف على الاستدلال القائم على المنهج التدريجي والتعلم المعزز الواعي بالمهمة.
  • يتفوق M$^3$R-Reasoner ذو الـ 8 مليار معلمة على نماذج MLLMs الخاصة الأكبر حجمًا ويحسن درجات تبرير الأدلة البصرية والمشاعر بنسبة 28.45 و30.11 نقطة على التوالي مقارنة بـ GPT-5.5.

يبرز المعيار صعوبة تقييم ما إذا كانت النماذج تقوم بإنشاء روابط مدعومة بأدلة بصرية ونصية، بينما يُظهر Reasoner المقترح تحسنًا في التوافق مع تفسير الاستعارة.