Les auteurs présentent Show-Harness, un Harness Incarné qui permet aux modèles de vision et de langage (VLM) de contrôler des robots via une interface sémantique compacte reliant l'intention à l'action. Ce système expose des unités d'action sémantiques discrètes pour le raisonnement VLM et utilise des interprètes spécifiques à l'incarnation pour les ancrer dans les actions locales du robot.

  • Débloque directement les VLM frontaux propriétaires pour le contrôle de robots en zero-shot.
  • Adapte les VLM open-source à petite échelle pour un déploiement à faible coût avec seulement quelques GPU-heures de fine-tuning.
  • Introduit GUMI (GUI Manipulation Interface) pour étendre l'espace d'action sémantique pour la collecte de démonstrations basées sur GUI.

Les agents VLM équipés de Show-Harness généralisent de manière robuste entre les tâches, les incarnations et les environnements, surpassant les paradigmes représentatifs d'agents et de VLA sans nécessiter de capacité de modèle supplémentaire ni de pré-entraînement spécifique à l'incarnation coûteux.