يقدم المؤلفون Show-Harness، وهو Harness متجسد يسمح لنماذج الرؤية واللغة (VLMs) بالتحكم في الروبوتات من خلال واجهة دلالية مدمجة تربط النية بالعمل. يكشف هذا النظام عن وحدات عمل دلالية منفصلة لاستدلال VLM ويستخدم مترجمين محددين للتجسيد لتأصيلها في إجراءات الروبوت المحلية.
- يفتح مباشرة نماذج VLM الحدودية المغلقة المصدر للتحكم في الروبوتات بدون تدريب (zero-shot).
- يتكيف مع نماذج VLM مفتوحة المصدر صغيرة النطاق للنشر منخفض التكلفة بساعات GPU قليلة فقط من الضبط الدقيق.
- يقدم GUMI (واجهة تعديل واجهة المستخدم الرسومية) لتوسيع مساحة العمل الدلية لجمع العروض التوضيحية القائمة على واجهة المستخدم الرسومية.
تعمم وكلاء VLM المزودة بـ Show-Harness بشكل قوي عبر المهام والتجسيدات والبيئات، متفوقةً على النماذج التمثيلية للوكلاء وVLA دون الحاجة إلى سعة نموذج إضافية أو تدريب مسبق محدد للتجسيد مكلف.