Исследователи предлагают SCOUT, фреймворк, который усиливает пространственное мышление Vision-Language Models путём объединения структурированного Chain-of-Thought с многоцелевым процесс-вознаграждающим reinforcement learning. Этот подход решает проблемы распределения кредита в существующих RL методах и интегрирует восприятие глубины для всестороннего 3D понимания.

  • SCUT вводит структурированный CoT фреймворк для явного моделирования 3D восприятия окружающей среды.
  • Метод использует новый RL алгоритм с многоцелевыми процесс-вознаграждениями и адаптированной оценкой преимущества для тонкого распределения кредита.
  • Новый датасет SCOUT-24k был синтезирован через кастомизированный пайплайн для поддержки обучения.
  • SCUT-3B превосходит базовые модели на 16.85% в общих пространственных бенчмарках и на 6.3% в сложных задачах.
  • Более крупная модель SCUT-7B превосходит GPT-4o на 4.28%, несмотря на то, что обучалась исключительно на одиночных изображениях.

Авторы считают SCUT критическим шагом к VLM следующего поколения с пространственной осведомлённостью, демонстрируя устойчивую обобщающую способность за пределами домена для много-изображенийных и видео сценариев.