著者らは、意図と行動を結びつけるコンパクトなセマンティックインターフェースを通じてビジョン・言語モデル(VLM)がロボットを制御できるようにするエンボディドハーネスであるShow-Harnessを発表します。このシステムはVLMの推論のために離散的なセマンティック行動ユニットを公開し、エンボディメント固有のインタプリタを使用してそれらをローカルロボットの行動に接地します。
- クローズドソースのフロンティアVLMをゼロショットロボット制御のために直接アンロックします。
- 数時間のGPU時間によるファインチューニングだけで、小規模なオープンソースVLMを低コスト展開に適応させます。
- GUIベースのデモンストレーション収集のためのセマンティック行動空間を拡張するGUMI(GUI Manipulation Interface)を導入します。
Show-Harnessを搭載したVLMエージェントは、タスク、エンボディメント、環境全体で堅牢に汎化し、追加のモデル容量や高価なエンボディメント固有の事前学習を必要とせずに、代表的なエージェントおよびVLAパラダイムを上回ります。