يقترح الباحثون إطار عمل SCOUT الذي يعزز الاستدلال المكاني لنماذج اللغة والرؤية من خلال دمج التفكير المتسلسل المهيكل مع التعلم التعزيزي متعدد الأهداف والمشرف على العملية. يتناول هذا النهج مشكلات تعيين الائتمان في طرق التعلم التعزيزي الحالية ودمك إدراك العمق لفهم شامل للبيئة ثلاثية الأبعاد.

  • يقدم SCOUT إطار عمل للتفكير المتسلسل المهيكل لنمذجة إدراك البيئة ثلاثية الأبعاد بشكل صريح.
  • تستخدم الطريقة خوارزمية تعلم تعزيزي جديدة بمكافآت عملية متعددة الأهداف وتقدير مزايا مخصص لتعيين ائتمان دقيق.
  • تم توليد مجموعة بيانات جديدة تسمى SCOUT-24k عبر خط أنابيب مخصص لدعم التدريب.
  • يحسّن SCOUT-3B النتائج مقارنة بالنماذج الأساسية بنسبة 16.85% على المقاييس المكانية العامة و6.3% على المهام المعقدة.
  • يتفوق النموذج الأكبر حجماً SCOUT-7B على GPT-4o بنسبة 4.28% رغم تدريبه حصرياً على صور مفردة.

ينظر المؤلفون إلى SCOUT كخطوة حاسمة نحو الجيل القادم من نماذج اللغة والرؤية الواعية مكانيًا، مما يُظهر تعميماً قوياً خارج نطاق البيانات في سيناريوهات الصور المتعددة ومقاطع الفيديو.