作者展示了 Show-Harness,这是一种具身 Harness,允许视觉-语言模型 (VLM) 通过连接意图与动作的紧凑语义接口来控制机器人。该系统为 VLM 推理暴露了离散的语义动作单元,并使用特定于具身的解释器将其映射到本地机器人动作。
- 直接解锁闭源前沿 VLM,用于零样本机器人控制。
- 通过仅需少量 GPU 小时的微调,将小规模开源 VLM 适配到低成本部署中。
- 引入 GUMI (GUI Manipulation Interface) 以扩展基于 GUI 的演示收集的语义动作空间。
配备 Show-Harness 的 VLM 智能体在任务、具身形态和环境之间展现出强大的泛化能力,无需额外的模型容量或昂贵的特定具身预训练,即可超越代表性的智能体和 VLA 范式。