연구자들은 SCOUT를 제안했는데, 이는 구조화된 사고사슬과 다목적 프로세스 보상 강화학습을 결합하여 비전-언어 모델의 공간 추론을 향상시키는 프레임워크입니다. 이 접근법은 기존 RL 방법의 신용 할당 문제를 해결하고 포괄적인 3D 이해를 위해 깊이 지각을 통합합니다.

  • SCOUT는 3D 환경 지각을 명시적으로 모델링하기 위해 구조화된 CoT 프레임워크를 도입합니다.
  • 이 방법은 세밀한 신용 할당을 위해 다목적 프로세스 보상과 맞춤화된 우도 추정이 포함된 새로운 RL 알고리즘을 활용합니다.
  • 훈련을 지원하기 위해 SCOUT-24k라는 새로운 데이터셋이 맞춤형 파이프라인을 통해 합성되었습니다.
  • SCOUT-3B는 일반 공간 벤치마크에서 16.85%, 복잡한 작업에서 6.3% 향상된 성능을 보이며 베이스라인을 능가합니다.
  • 더 큰 SCOUT-7B 모델은 단일 이미지로만 훈련되었음에도 불구하고 GPT-4o보다 4.28% 뛰어난 성능을 보입니다.

저자들은 SCOUT를 차세대 공간 인식 VLM으로 가는 중요한 단계로 간주하며, 다중 이미지 및 비디오 시나리오에 대한 견고한 도메인 외부 일반화를 입증했습니다.