Microsoft Research a présenté MindTopo, un nouveau benchmark conçu pour évaluer si les grands modèles de langage multimodaux possèdent une intuition topologique concernant la connectivité, l'encerclement, l'ordre, la séparation et les nœuds.

  • Le benchmark organise les tâches en cinq catégories : continuité, séparation, ordre, encerclement et nœuds.
  • Il mesure les performances à deux niveaux cognitifs : le raisonnement sur des scènes statiques et la planification par des séquences interactives d'actions.
  • Toutes les scènes sont générées à partir de simulateurs contrôlés pour fournir une vérité terrain exacte et une difficulté ajustable.
  • Les modèles actuels performant nettement mieux sur les tâches de reconnaissance statique que sur les tâches de planification interactive.
  • Les échecs en planification proviennent souvent de la perte de repère des relations structurelles lorsque les scènes changent ou de la proposition d'actions qui violent les contraintes physiques.

Les résultats mettent en évidence un écart substantiel entre la reconnaissance de la topologie dans une image statique et le maintien de sa compréhension lors de l'action, suggérant une opportunité pour faire progresser les systèmes d'IA pour la robotique et les environnements interactifs.