Los autores presentan Show-Harness, un Harness Encarnado que permite a los modelos de visión y lenguaje (VLM) controlar robots a través de una interfaz semántica compacta que vincula la intención con la acción. Este sistema expone unidades de acción semánticas discretas para el razonamiento VLM y utiliza intérpretes específicos de la encarnación para anclarlos en acciones locales del robot.
- Desbloquea directamente VLM front-end propietarios para el control de robots zero-shot.
- Adapta VLM abiertos a pequeña escala para un despliegue de bajo costo con solo unas pocas GPU-horas de ajuste fino.
- Introduce GUMI (GUI Manipulation Interface) para extender el espacio de acción semántica para la recolección de demostraciones basadas en GUI.
Los agentes VLM equipados con Show-Harness se generalizan de manera robusta entre tareas, encarnaciones y entornos, superando a los paradigmas representativos de agentes y VLA sin requerir capacidad adicional del modelo ni preentrenamiento específico de la encarnación costoso.