Los investigadores proponen SCOUT, un marco que mejora el razonamiento espacial de los Modelos Visión-Lenguaje combinando Chain-of-Thought estructurado con aprendizaje por refuerzo de recompensa de proceso multiobjetivo. Este enfoque aborda problemas de asignación de crédito en métodos RL existentes e integra la percepción de profundidad para una comprensión 3D integral.
- SCUT introduce un marco CoT estructurado para modelar explícitamente la percepción del entorno 3D.
- El método utiliza un nuevo algoritmo RL con recompensas de proceso multiobjetivo y estimación de ventaja adaptada para una asignación de crédito fina.
- Se sintetizó un nuevo conjunto de datos, SCOUT-24k, a través de una tubería personalizada para apoyar el entrenamiento.
- SCOUT-3B mejora las líneas base en un 16.85% en benchmarks espaciales generales y en un 6.3% en tareas complejas.
- El modelo más grande SCOUT-7B supera a GPT-4o en un 4.28% a pesar de estar entrenado exclusivamente con imágenes individuales.
Los autores consideran que SCUT es un paso crítico hacia los VLM espacialmente conscientes de próxima generación, demostrando una generalización robusta fuera del dominio para escenarios de múltiples imágenes y video.