A Microsoft Research apresentou o MindTopo, um novo benchmark projetado para avaliar se modelos de linguagem multimodais de grande porte possuem intuição topológica sobre conectividade, contenção, ordem, separação e nós.

  • O benchmark organiza as tarefas em cinco categorias: continuidade, separação, ordem, contenção e nós.
  • Ele mede o desempenho em dois níveis cognitivos: raciocínio sobre cenas estáticas e planejamento por meio de sequências interativas de ações.
  • Todas as cenas são geradas a partir de simuladores controlados para fornecer uma verdade fundamental exata e dificuldade ajustável.
  • Os modelos atuais têm desempenho significativamente melhor em tarefas de reconhecimento estático do que em tarefas de planejamento interativo.
  • As falhas no planejamento frequentemente decorrem da perda de rastreamento das relações estruturais à medida que as cenas mudam ou da proposição de ações que violam restrições físicas.

As descobertas destacam uma lacuna substancial entre reconhecer a topologia em uma imagem estática e manter o entendimento dela enquanto age, sugerindo uma oportunidade de avançar sistemas de IA para robótica e ambientes interativos.