Para peneliti memperkenalkan M$^3$R-Bench, sebuah benchmark terpadu yang berisi 1.000 contoh gambar-teks dengan anotasi yang diverifikasi manusia, dirancang untuk mengevaluasi pemahaman metafora multimodal yang berdasar pada bukti. Benchmark ini menyediakan anotasi gabungan untuk kejadian metafora, pemetaan Target-Sumber, sentimen, dan penjelasan bertahap berdasarkan Teori Metafora Konseptual.

  • M$^3$R-Bench mengevaluasi model dalam penalaran lintas modal dengan memerlukan identifikasi bukti, pembentukan pemetaan, dan inferensi sentimen.
  • Evaluasi mengungkapkan bahwa model-model yang ada sering mengabaikan bukti visual dan mengandalkan petunjuk teks yang dangkal, sehingga menyingkap ketidaksesuaian pemetaan bukti lintas modal.
  • Untuk mengatasi hal ini, para penulis mengusulkan M$^3$R-Reasoner, yang menggabungkan pengawasan penalaran berbasis kurikulum dengan pembelajaran penguatan yang sadar tugas.
  • M$^3$R-Reasoner dengan 8 miliar parameter melebihi MLLM komersial yang lebih besar dan meningkatkan skor Justifikasi Bukti Visual dan Sentimen sebesar 28,45 dan 30,11 poin dibandingkan GPT-5.5.

Benchmark ini menyoroti kesulitan dalam menilai apakah model membentuk pemetaan yang berdasar pada petunjuk visual dan teks, sementara reasoner yang diusulkan menunjukkan keselarasan yang lebih baik dengan interpretasi metafora.