微软研究院推出了MindTopo,这是一个旨在评估多模态大语言模型是否具备关于连通性、包围性、顺序性、分离性和结拓扑直觉的新基准。

  • 该基准将任务分为五类:连续性、分离性、顺序性、包围性和结。
  • 它在两个认知层面衡量性能:对静态场景的推理以及通过交互式动作序列进行规划。
  • 所有场景均由受控模拟器生成,以提供精确的真实标签和可调节的难度。
  • 当前模型在静态识别任务上的表现显著优于交互式规划任务。
  • 规划失败通常源于在场景变化时丢失对结构关系的追踪,或提出违反物理约束的动作。

研究结果凸显了在静态图像中识别拓扑与在行动过程中维持对其理解之间存在巨大差距,这表明为机器人和交互式环境推进AI系统存在机遇。