Los autores presentan Show-Harness, un Harness Encarnado que permite a los modelos de visión y lenguaje (VLM) controlar robots a través de una interfaz semántica compacta que vincula la intención con la acción. Este sistema expone unidades de acción semánticas discretas para el razonamiento VLM y utiliza intérpretes específicos de la encarnación para anclarlos en acciones locales del robot.

  • Desbloquea directamente VLM front-end propietarios para el control de robots zero-shot.
  • Adapta VLM abiertos a pequeña escala para un despliegue de bajo costo con solo unas pocas GPU-horas de ajuste fino.
  • Introduce GUMI (GUI Manipulation Interface) para extender el espacio de acción semántica para la recolección de demostraciones basadas en GUI.

Los agentes VLM equipados con Show-Harness se generalizan de manera robusta entre tareas, encarnaciones y entornos, superando a los paradigmas representativos de agentes y VLA sin requerir capacidad adicional del modelo ni preentrenamiento específico de la encarnación costoso.