Pesquisadores propõem o SCOUT, um framework que aprimora o raciocínio espacial de Modelos Visão-Linguagem ao combinar Chain-of-Thought estruturada com aprendizado por reforço de recompensa de processo multiobjetivo. Essa abordagem aborda problemas de atribuição de crédito em métodos de RL existentes e integra percepção de profundidade para compreensão 3D abrangente.
- SCUT introduz um framework CoT estruturado para modelar explicitamente a percepção do ambiente 3D.
- O método utiliza um algoritmo de RL novelo com recompensas de processo multiobjetivo e estimação de vantagem adaptada para atribuição de crédito em nível fino.
- Um novo conjunto de dados, SCOUT-24k, foi sintetizado por meio de um pipeline personalizado para apoiar o treinamento.
- SCOUT-3B supera as linhas de base em 16,85% em benchmarks espaciais gerais e em 6,3% em tarefas complexas.
- O modelo maior SCOUT-7B supera o GPT-4o em 4,28%, apesar de ter sido treinado exclusivamente com imagens únicas.
Os autores consideram o SCUT um passo crítico rumo aos VLMs espacialmente conscientes de próxima geração, demonstrando generalização robusta fora do domínio para cenários com múltiplas imagens e vídeo.