शोधकर्ता SpatialClaw का प्रस्ताव करते हैं, एक ट्रेनिंग-मुक्त फ्रेमवर्क जो दृश्य-भाषा मॉडल में खुले-अंत 3D और 4D स्थानिक तर्क को सुधारने के लिए क्रिया इंटरफ़ेस के रूप में कोड अपनाता है। मौजूदा एजेंट्स के विपरीत जो सिंगल-पास एक्जीक्यूशन या रिजिड टूल कॉल्स पर निर्भर करते हैं, SpatialClaw इनपुट फ्रेम्स और परसेप्शन प्रिमिटिव्स से पूर्व-लोडेड एक स्टेटफुल Python kernel बनाए रखता है।

  • एजेंट सभी पूर्व आउटपुट पर शर्ती प्रति चरण एक एक्जीक्यूटेबल सेल लिखता है, जिससे परसेप्शन परिणामों का लचीला संयोजन संभव होता है।
  • 20 स्थानिक तर्क बेंचमार्क्स पर मूल्यांकन किया गया, SpatialClaw ने 59.9% औसत सटीकता हासिल की।
  • यह प्रदर्शन हाल के स्थानिक एजेंट से +11.2 अंक से बेहतर है, दो मॉडल परिवारों से छह VLM backbones पर लगातार लाभ के साथ।

यह दृष्टिकोण एजेंट्स को इंटरमीडिएट टेक्स्ट और विज़ुअल अवलोकनों के अनुसार अपने विश्लेषण को अनुकूलित करने की अनुमति देता है, बिना बेंचमार्क- या मॉडल-विशिष्ट अनुकूलन के।