Авторы представляют Show-Harness, воплощённый Harness, который позволяет моделям с зрительно-языковыми возможностями (VLM) управлять роботами через компактный семантический интерфейс, связывающий намерение с действием. Эта система предоставляет дискретные семантические единицы действий для рассуждений VLM и использует интерпретаторы, специфичные для воплощения, чтобы привязать их к локальным действиям робота.
- Непосредственно открывает закрытые передовые VLM для управления роботами в режиме zero-shot.
- Адаптирует маломасштабные открытые VLM для развёртывания с низкой стоимостью, требуя лишь нескольких GPU-часов дообучения.
- Вводит GUMI (GUI Manipulation Interface) для расширения семантического пространства действий при сборе демонстраций на основе графического интерфейса.
Агенты VLM, оснащённые Show-Harness, демонстрируют устойчивую обобщающую способность в задачах, воплощениях и средах, превосходя репрезентативные парадигмы агентов и VLA без необходимости увеличения ёмкости модели или дорогостоящего предобучения, специфичного для воплощения.