В статье представлен RECALL — активная парадигма непрерывного обучения для моделей Vision-Language-Action (VLA), которая устраняет неэффективности пассивного обучения с подражанием. В отличие от традиционных методов, требующих отказов робота для инициирования сбора данных, данный подход использует демонстрации восстановления, направляемые неопределённостью, для проактивного выявления состояний, нуждающихся в надзоре. Авторы демонстрируют, что такой целевой сбор данных приводит к более эффективной донастройке по сравнению с пассивно собранными демонстрациями. Однако исследование показывает, что донастройка исключительно на этих активных данных восстановления вызывает катастрофическое забывание ранее изученных поведений. Для смягчения этой проблемы в работе оцениваются техники непрерывного обучения, такие как смешивание данных на основе воспроизведения и эластичная консолидация весов. Эти эксперименты подчеркивают критические компромиссы между пластичностью для новых задач и сохранением существующих возможностей в авторегрессионных VLA. В конечном итоге исследование устанавливает, что, хотя восстановление, направляемое неопределённостью, повышает эффективность адаптации, интеграция целевых новых данных в крупные роботизированные политики представляет значительные открытые проблемы.
RECALL: Активное пожизненное обучение для моделей Vision-Language-Action
Dyna Robotics выпустила Dyna-2, модель мира и действий, предварительно обученную на 1 миллионе часов человеческих видео
Dyna Robotics выпустила Dyna-2, модель мира и действий для манипуляции роботов, предварительно обученную на более чем одном миллионе часов эгоцентричных человеческих видео. Компания демонстрирует, что обычные человеческие видео могут заменить данные с метками действий, установив закон масштабирования от 1 000 до 1 000 000 часов.
Обзор движков симуляции для Physical AI: MuJoCo, Isaac Sim и Newton
В данной статье представлен обзор текущего состояния симуляции в области Physical AI, объясняющий, как симуляция преодолевает разрыв в данных для робототехники за счёт создания масштабируемых фотореалистичных обучающих сред. Описывается парадигма с использованием трёх компьютеров (обучение, симуляция, на роботе) и классифицируются ключевые движки симуляции на основе их специфических возможностей и областей применения.
RoboTTT масштабирует политики роботов до контекста в 8 тысяч шагов по времени
Исследователи представляют RoboTTT, рецепт обучения, который расширяет визуомоторный контекст для фундаментальных моделей роботов до 8000 шагов по времени без увеличения задержки вывода. Метод интегрирует обучение во время тестирования в политики Vision-Language-Action с использованием быстрых весов, обновляемых посредством градиентного спуска как во время обучения, так и при выводе.
RoboTTT масштабирует политики роботов до контекста в 8 тысяч шагов
NVIDIA представляет RoboTTT, фундаментальную модель для роботов и рецепт обучения, который расширяет визуомоторный контекст до 8000 шагов без увеличения задержки вывода. Интегрируя обучение во время тестирования (Test-Time Training) в политики Vision-Language-Action, система сжимает историю в пространстве весов с использованием быстрых весов, обновляемых методом градиентного спуска.
RECALL: Коллекция данных для восстановления опыта в активном непрерывном обучении моделей Vision-Language-Action
В данной статье предлагается активная парадигма непрерывного обучения для моделей Vision-Language-Action (VLA), направленная на устранение неэффективности пассивного обучения с подражанием. Авторы демонстрируют, что сбор данных, направляемый неопределённостью, повышает эффективность дообучения, но приводит к катастрофическому забыванию при исключительно использовании данных восстановления.