저자들은 Show-Harness를 제시합니다. 이는 의도를 액션에 연결하는 컴팩트한 시맨틱 인터페이스를 통해 비전-언어 모델(VLM)이 로봇을 제어할 수 있도록 하는 임바디드 허니스입니다. 이 시스템은 VLM 추론을 위해 이산 시맨틱 액션 유닛을 노출하고, 임바디먼트 특화 인터프리터를 사용하여 이를 로컬 로봇 액션에 grounding합니다.

  • 제로샷 로봇 제어를 위해 클로즈드 소스 프런티어 VLM을 직접 잠금 해제합니다.
  • 몇 시간의 GPU 시간만 필요한 파인튜닝으로 소규모 오픈소스 VLM을 저비용 배포에 적응시킵니다.
  • GUI 기반 데모 수집을 위해 시맨틱 액션 공간을 확장하는 GUMI(GUI Manipulation Interface)를 도입합니다.

Show-Harness가 장착된 VLM 에이전트는 작업, 임바디먼트 및 환경 전반에 걸쳐 강건하게 일반화하며, 추가 모델 용량이나 비용이 많이 드는 임바디먼트 특화 사전 학습 없이도 대표적인 에이전틱 및 VLA 패러다임을 능가합니다.