Para penulis menyajikan Show-Harness, sebuah Harness Berbadan yang memungkinkan model visi-bahasa (VLM) mengendalikan robot melalui antarmuka semantik ringkas yang menghubungkan niat ke aksi. Sistem ini mengekspos unit aksi semantik diskrit untuk penalaran VLM dan menggunakan interpreter spesifik perwujudan untuk mengaitkannya dengan aksi robot lokal.
- Secara langsung membuka kunci VLM frontier tertutup-sumber untuk pengendalian robot zero-shot.
- Menyesuaikan VLM open-source skala kecil untuk penyebaran biaya rendah dengan hanya beberapa jam GPU fine-tuning.
- Memperkenalkan GUMI (GUI Manipulation Interface) untuk memperluas ruang aksi semantik untuk pengumpulan demonstrasi berbasis GUI.
Agen VLM yang dilengkapi Show-Harness menggeneralisasi secara robust di seluruh tugas, perwujudan, dan lingkungan, mengalahkan paradigma agen dan VLA yang representatif tanpa memerlukan kapasitas model tambahan atau pra-pelatihan spesifik perwujudan yang mahal.