يقترح الباحثون SpatialClaw، إطار عمل خالٍ من التدريب يعتمد على الكود كواجهة إجراء لتحسين الاستدلال المكاني المفتوح 3D و4D في نماذج الرؤية واللغة. على عكس الوكلاء الحاليين الذين يعتمدون على التنفيذ ذو المرور الواحد أو استدعاءات الأدوات الجامدة، يحافظ SpatialClaw على نواة Python ذات حالة محملة مسبقاً بإطارات الإدخال ومبادئ الاستيعاب.
- يكتب الوكيل خلية قابلة للتنفيذ واحدة لكل خطوة مشروطة بجميع المخرجات السابقة، مما يسمح بتكوين مرن لنتائج الاستيعاب.
- تم تقييمه عبر 20 معياراً للاستدلال المكاني، حيث حقق SpatialClaw دقة متوسطة تبلغ 59.9%.
- تتفوق هذه الأداء على الوكيل المكاني الحديث بمقدار +11.2 نقطة مع مكاسب متسقة عبر ستة VLM backbones من عائلتي نماذج.
يتيح هذا النهج للوكلاء تكييف تحليلهم مع الملاحظات النصية والمرئية الوسيطة دون تكيف محدد للمعيار أو النموذج.