研究者らは、構造化Chain-of-Thoughtと多目的プロセス報酬強化学習を組み合わせることで、Vision-Language Modelsの空間推論を強化するフレームワークであるSCOUTを提案した。このアプローチは、既存のRL手法における信用帰属の問題に対処し、包括的な3D理解のために深度知覚を統合する。

  • SCOUTは、3D環境知覚を明示的にモデル化するための構造化CoTフレームワークを導入する。
  • この手法は、微細な信用帰属のために多目的プロセス報酬と調整されたアドバンテージ推定を用いた新規RLアルゴリズムを利用する。
  • 訓練をサポートするために、SCOUT-24kという新データセットがカスタマイズされたパイプラインを通じて合成された。
  • SCOUT-3Bは、一般的な空間ベンチマークでベースラインを16.85%上回り、複雑なタスクでは6.3%上回った。
  • より大規模なSCOUT-7Bモデルは、単一画像のみで訓練されているにもかかわらず、GPT-4oを4.28%上回った。

著者らは、SCOUTを次世代の空間認識型VLMへの重要な一歩とみなしており、複数画像や動画シナリオに対する堅牢なドメイン外一般化を示している。