Para peneliti mengusulkan SCOUT, sebuah kerangka kerja yang meningkatkan penalaran spasial Model Bahasa-Gambar dengan menggabungkan Chain-of-Thought terstruktur dengan pembelajaran penguatan reward proses multi-tujuan. Pendekatan ini mengatasi masalah penugasan kredit pada metode RL yang ada dan mengintegrasikan persepsi kedalaman untuk pemahaman 3D yang komprehensif.
- SCUT memperkenalkan kerangka kerja CoT terstruktur untuk secara eksplisit memodelkan persepsi lingkungan 3D.
- Metode ini memanfaatkan algoritma RL baru dengan reward proses multi-tujuan dan estimasi keunggulan yang disesuaikan untuk penugasan kredit berbutir halus.
- Dataset baru, SCOUT-24k, disintesis melalui pipeline khusus untuk mendukung pelatihan.
- SCOUT-3B meningkatkan baseline sebesar 16,85% pada benchmark spasial umum dan 6,3% pada tugas kompleks.
- Model SCOUT-7B yang lebih besar mengungguli GPT-4o sebesar 4,28% meskipun dilatih secara eksklusif pada gambar tunggal.
Para penulis menganggap SCUT sebagai langkah kritis menuju VLM generasi berikutnya yang sadar spasial, menunjukkan generalisasi out-of-domain yang kuat untuk skenario multi-gambar dan video.