शोधकर्ताओं ने M$^3$R-Bench पेश किया, एक एकीकृत मानदंड जिसमें 1,000 छवि-पाठ उदाहरण शामिल हैं, जिनमें प्रमाण-आधारित बहुआयामी रूपक समझ का मूल्यांकन करने के लिए मानव-सत्यापित टिप्पणियाँ दी गई हैं। यह मानदंड रूपक की उपस्थिति, लक्ष्य-स्रोत मैपिंग, भावनात्मक स्थिति और अवधारणात्मक रूपक सिद्धांत पर आधारित चरण-दर-चरण व्याख्याओं के लिए संयुक्त टिप्पणियाँ प्रदान करता है।

  • M$^3$R-Bench प्रमाण की पहचान, मैपिंग स्थापना और भावनात्मक निष्कर्ष निकालने की आवश्यकता द्वारा मॉडल का क्रॉस-मोडल तर्क पर मूल्यांकन करता है।
  • मूल्यांकन से पता चलता है कि मौजूदा मॉडल अक्सर दृश्य प्रमाण को नजरअंदाज कर देते हैं और सतही पाठ संकेतों पर निर्भर रहते हैं, जिससे क्रॉस-मोडल प्रमाण-मैपिंग में असंगति सामने आती है।
  • इस समस्या को हल करने के लिए, लेखकों ने M$^3$R-Reasoner का प्रस्ताव रखा है, जो पाठ्यक्रम-आधारित तर्क निगरानी और कार्य-जागरूक पुनर्बल सीखने को जोड़ता है।
  • 8B-पैरामीटर वाला M$^3$R-Reasoner बड़े स्वामित्व वाले MLLMs से बेहतर प्रदर्शन करता है और GPT-5.5 की तुलना में दृश्य प्रमाण और भावनात्मक औचित्य स्कोर में क्रमशः 28.45 और 30.11 अंक की सुधार लाता है।

यह मानदंड यह आकलन करने की कठिनाई को उजागर करता है कि क्या मॉडल दृश्य और पाठ संकेतों पर आधारित मैपिंग स्थापित करते हैं, जबकि प्रस्तावित तर्ककर्ता रूपक व्याख्या के साथ बेहतर समन्वय दिखाता है।