Para peneliti mengusulkan SCOUT, sebuah kerangka kerja yang meningkatkan penalaran spasial Model Bahasa-Gambar dengan menggabungkan Chain-of-Thought terstruktur dengan pembelajaran penguatan reward proses multi-tujuan. Pendekatan ini mengatasi masalah penugasan kredit pada metode RL yang ada dan mengintegrasikan persepsi kedalaman untuk pemahaman 3D yang komprehensif.

  • SCUT memperkenalkan kerangka kerja CoT terstruktur untuk secara eksplisit memodelkan persepsi lingkungan 3D.
  • Metode ini memanfaatkan algoritma RL baru dengan reward proses multi-tujuan dan estimasi keunggulan yang disesuaikan untuk penugasan kredit berbutir halus.
  • Dataset baru, SCOUT-24k, disintesis melalui pipeline khusus untuk mendukung pelatihan.
  • SCOUT-3B meningkatkan baseline sebesar 16,85% pada benchmark spasial umum dan 6,3% pada tugas kompleks.
  • Model SCOUT-7B yang lebih besar mengungguli GPT-4o sebesar 4,28% meskipun dilatih secara eksklusif pada gambar tunggal.

Para penulis menganggap SCUT sebagai langkah kritis menuju VLM generasi berikutnya yang sadar spasial, menunjukkan generalisasi out-of-domain yang kuat untuk skenario multi-gambar dan video.