Les chercheurs proposent SCOUT, un cadre qui améliore le raisonnement spatial des Modèles Vision-Language en combinant une Chaîne de Pensée structurée avec un apprentissage par renforcement à récompense de processus multi-objectif. Cette approche traite les problèmes d'attribution de crédit dans les méthodes RL existantes et intègre la perception de la profondeur pour une compréhension 3D complète.

  • SCOUT introduit un cadre CoT structuré pour modéliser explicitement la perception de l'environnement 3D.
  • La méthode utilise un nouvel algorithme RL avec des récompenses de processus multi-objectif et une estimation d'avantage sur mesure pour une attribution de crédit fine-grained.
  • Un nouveau jeu de données, SCOUT-24k, a été synthétisé via un pipeline personnalisé pour soutenir l'entraînement.
  • SCOUT-3B améliore les modèles de base de 16,85 % sur les benchmarks spatiaux généraux et de 6,3 % sur les tâches complexes.
  • Le modèle plus grand SCOUT-7B surpasse GPT-4o de 4,28 % bien qu'entraîné exclusivement sur des images uniques.

Les auteurs considèrent SCOUT comme une étape critique vers les VLM spatialement conscients de nouvelle génération, démontrant une généralisation robuste hors domaine aux scénarios multi-images et vidéo.