Microsoft Research telah memperkenalkan MindTopo, sebuah benchmark baru yang dirancang untuk mengevaluasi apakah model bahasa besar multimodal memiliki intuisi topologis mengenai konektivitas, pengurungan, urutan, pemisahan, dan simpul.

  • Benchmark ini mengorganisasikan tugas ke dalam lima kategori: kontinuitas, pemisahan, urutan, pengurungan, dan simpul.
  • Benchmark ini mengukur kinerja pada dua tingkat kognitif: penalaran pada adegan statis dan perencanaan melalui urutan tindakan interaktif.
  • Semua adegan dihasilkan dari simulator terkontrol untuk memberikan kebenaran dasar yang tepat dan kesulitan yang dapat disesuaikan.
  • Model saat ini berkinerja jauh lebih baik pada tugas pengenalan statis dibandingkan dengan tugas perencanaan interaktif.
  • Kegagalan dalam perencanaan sering kali berasal dari kehilangan jejak hubungan struktural saat adegan berubah atau mengusulkan tindakan yang melanggar batasan fisik.

Temuan tersebut menyoroti kesenjangan substansial antara mengenali topologi dalam gambar statis dan mempertahankan pemahaman tentangnya sambil bertindak, menunjukkan peluang untuk memajukan sistem AI untuk robotika dan lingkungan interaktif.