NVIDIA 연구진은 다중 모달 대규모 언어 모델(MLLMs)의 공간 지능을 해체하기 위해 설계된 진단 프레임워크인 Spatial-IQ를 출시했습니다. 모델을 블랙 박스로 취급하는 기존 벤치마크와 달리, 이 접근 방식은 쌓여 있는 3D 구조에서의 객체 카운팅을 인간 발달 단계와 일치하는 아홉 가지 지각 및 인지 하위 작업으로 분해합니다.

  • 프레임워크는 NVIDIA Isaac Sim를 활용하여 각 하위 작업에 대한 정답이 포함된 약 80,000개의 쌓여 있는 3D 구조 데이터셋을 절차적으로 생성합니다.
  • 자유 응답 텍스트, 객관식 이미지, 이미지 편집 형식에 걸친 평가 결과, 상위 성능 모델은 종종 목표 작업을 성공하지만 하위 수준의 하위 작업에서는 실패하여 단축 행위를 나타냈습니다.
  • 이 연구는 이러한 계층적 하위 작업에 대한 사후 사고(supervision)와 검증 가능한 보상 강화 학습을 결합하여 훈련하면 공간 일관성과 목표 작업 정확도가 모두 크게 향상됨을 보여줍니다.

이 분해는 특정 실패 모드를 식별하는 진단 도구이자 MLLMs의 공간 추론 강건성을 향상시키기 위한 효과적인 훈련 신호로 작용합니다.