Microsoft Research ha presentado MindTopo, un nuevo benchmark diseñado para evaluar si los modelos de lenguaje multimodales grandes poseen intuición topológica respecto a conectividad, contención, orden, separación y nudos.
- El benchmark organiza las tareas en cinco categorías: continuidad, separación, orden, contención y nudos.
- Mide el rendimiento en dos niveles cognitivos: razonamiento sobre escenas estáticas y planificación a través de secuencias interactivas de acciones.
- Todas las escenas se generan a partir de simuladores controlados para proporcionar una verdad fundamental exacta y una dificultad ajustable.
- Los modelos actuales tienen un rendimiento significativamente mejor en tareas de reconocimiento estático que en tareas de planificación interactiva.
- Las fallas en la planificación a menudo provienen de perder el rastro de las relaciones estructurales a medida que cambian las escenas o de proponer acciones que violan restricciones físicas.
Los hallazgos destacan una brecha sustancial entre reconocer la topología en una imagen estática y mantener una comprensión de la misma mientras se actúa, lo que sugiere una oportunidad para avanzar los sistemas de IA para robótica y entornos interactivos.