Os autores apresentam o Show-Harness, um Harness Encarnado que permite que modelos de visão e linguagem (VLM) controlem robôs através de uma interface semântica compacta que vincula intenção a ação. Este sistema expõe unidades de ação semânticas discretas para o raciocínio VLM e utiliza interpretadores específicos da encarnação para ancorá-los em ações locais do robô.

  • Desbloqueia diretamente VLM front-end proprietários para controle de robôs zero-shot.
  • Adapta VLM abertos de pequena escala para implantação de baixo custo com apenas algumas GPU-horas de ajuste fino.
  • Introduz o GUMI (GUI Manipulation Interface) para estender o espaço de ação semântica para a coleta de demonstrações baseadas em GUI.

Agentes VLM equipados com Show-Harness generalizam de forma robusta entre tarefas, encarnações e ambientes, superando paradigmas representativos de agentes e VLA sem exigir capacidade adicional do modelo ou pré-treinamento específico da encarnação custoso.