लेखकों ने Show-Harness प्रस्तुत किया, एक एंबॉडीड हार्नेस जो विज़न-लैंग्वेज मॉडल्स (VLMs) को इरादे से एक्शन को लिंक करने वाले एक कॉम्पैक्ट सेमांटिक इंटरफ़ेस के माध्यम से रोबोट्स को नियंत्रित करने की अनुमति देता है। यह सिस्टम VLM तर्क के लिए डिसक्रिट सेमांटिक एक्शन यूनिट्स को एक्सपोज़ करता है और उन्हें स्थानीय रोबोट एक्शन में ग्राउंड करने के लिए एंबॉडिमेंट-स्पेसिफिक इंटरप्रेटर्स का उपयोग करता है।

  • सीधे तौर पर ज़ीरो-शॉट रोबोट नियंत्रण के लिए क्लोस्ड-सोर्स फ्रंटियर VLMs को अनलॉक करता है।
  • केवल कुछ GPU-घंटे के फाइन-ट्यूनिंग के साथ कम लागत वाले डिप्लॉयमेंट के लिए छोटे-स्केल ओपन-सोर्स VLMs को एडाप्ट करता है।
  • GUI-आधारित डेमोनस्ट्रेशन संग्रह के लिए सेमांटिक एक्शन स्पेस को विस्तारित करने के लिए GUMI (GUI Manipulation Interface) पेश करता है।

Show-Harness से लैस VLM एजेंट्स कार्यों, एंबॉडिमेंट्स और वातावरणों में मज़बूती से सामान्यीकृत होते हैं, अतिरिक्त मॉडल क्षमता या महंगे एंबॉडिमेंट-स्पेसिफिक प्रीट्रेनिंग की आवश्यकता के बिना प्रतिनिधि एजेंटिक और VLA पैराडाइम्स को पार करते हुए।