研究人员提出SCOUT,一种结合结构化思维链与多目标过程奖励强化学习的框架,以增强视觉-语言模型的空间推理能力。该方法解决了现有强化学习方法中的信用分配问题,并整合了深度感知以实现全面的3D理解。
- SCOUT引入结构化思维链框架,显式建模3D环境感知。
- 该方法采用一种新型强化学习算法,具备多目标过程奖励和定制化的优势估计,用于细粒度的信用分配。
- 通过定制化管道合成新数据集SCOUT-24k以支持训练。
- SCOUT-3B在通用空间基准测试中比基线提升16.85%,在复杂任务上提升6.3%。
- 更大的SCOUT-7B模型尽管仅使用单张图像进行训练,其性能仍超越GPT-4o达4.28%。
作者认为SCOUT是迈向下一代空间感知VLM的关键一步,展示了在多图像和视频场景中对域外泛化的鲁棒性。