Авторы представляют Show-Harness, воплощённый Harness, который позволяет моделям с зрительно-языковыми возможностями (VLM) управлять роботами через компактный семантический интерфейс, связывающий намерение с действием. Эта система предоставляет дискретные семантические единицы действий для рассуждений VLM и использует интерпретаторы, специфичные для воплощения, чтобы привязать их к локальным действиям робота.

  • Непосредственно открывает закрытые передовые VLM для управления роботами в режиме zero-shot.
  • Адаптирует маломасштабные открытые VLM для развёртывания с низкой стоимостью, требуя лишь нескольких GPU-часов дообучения.
  • Вводит GUMI (GUI Manipulation Interface) для расширения семантического пространства действий при сборе демонстраций на основе графического интерфейса.

Агенты VLM, оснащённые Show-Harness, демонстрируют устойчивую обобщающую способность в задачах, воплощениях и средах, превосходя репрезентативные парадигмы агентов и VLA без необходимости увеличения ёмкости модели или дорогостоящего предобучения, специфичного для воплощения.