A Microsoft Research apresentou o MindTopo, um novo benchmark projetado para avaliar se modelos de linguagem multimodais de grande porte possuem intuição topológica sobre conectividade, contenção, ordem, separação e nós.
- O benchmark organiza as tarefas em cinco categorias: continuidade, separação, ordem, contenção e nós.
- Ele mede o desempenho em dois níveis cognitivos: raciocínio sobre cenas estáticas e planejamento por meio de sequências interativas de ações.
- Todas as cenas são geradas a partir de simuladores controlados para fornecer uma verdade fundamental exata e dificuldade ajustável.
- Os modelos atuais têm desempenho significativamente melhor em tarefas de reconhecimento estático do que em tarefas de planejamento interativo.
- As falhas no planejamento frequentemente decorrem da perda de rastreamento das relações estruturais à medida que as cenas mudam ou da proposição de ações que violam restrições físicas.
As descobertas destacam uma lacuna substancial entre reconhecer a topologia em uma imagem estática e manter o entendimento dela enquanto age, sugerindo uma oportunidade de avançar sistemas de IA para robótica e ambientes interativos.