마이크로소프트 리서치는 연결성, 포위, 순서, 분리 및 매듭에 대한 위상적 직관을 다중 모달 대규모 언어 모델이 갖추고 있는지 평가하기 위해 설계된 새로운 벤치마크인 MindTopo를 선보였습니다.

  • 이 벤치마크는 작업을 연속성, 분리, 순서, 포위 및 매듭의 다섯 가지 범주로 구성합니다.
  • 정적 장면에서의 추론과 상호작용적 행동 시퀀스를 통한 계획이라는 두 가지 인지 수준에서 성능을 측정합니다.
  • 모든 장면은 정확한 정답과 조정 가능한 난이도를 제공하기 위해 제어된 시뮬레이터에서 생성됩니다.
  • 현재 모델은 정적 인식 작업에서 상호작용 계획 작업보다 훨씬 더 우수한 성능을 보입니다.
  • 계획 실패는 종종 장면이 변경될 때 구조적 관계를 놓치거나 물리적 제약을 위반하는 행동을 제안하는 데서 비롯됩니다.

이 결과는 정적 이미지에서 위상을 인식하는 것과 행동하면서 이를 이해하는 것 사이의 상당한 격차를 강조하며, 로봇 공학 및 상호작용 환경용 AI 시스템을 발전시킬 기회를 시사합니다.