Dyna Robotics выпустила Dyna-2, модель мира и действий для манипуляции роботов, предварительно обученную на более чем одном миллионе часов эгоцентричных человеческих видео. Компания демонстрирует, что обычные человеческие видео могут заменить данные с метками действий, установив закон масштабирования от 1 000 до 1 000 000 часов.
- Dyna-2 — это генеративная модель на основе видеодиффузии, которая совместно очищает от шума будущие видео и фрагменты действий.
- Модель демонстрирует закон масштабирования на человеческих данных, который переносится в zero-shot режиме на невидимые задачи роботов на двух стационарных бимануальных платформах.
- Совместная очистка от шума видео и действий превосходит обучение только по действиям, при этом видео особенно способствует обобщению между разными воплощениями (embodiments).
- После дообучения на 14 задачах средние нормализованные баллы выросли с 20% до 53% по мере масштабирования данных до одного миллиона часов.
- Dyna-2 прошла производственные критерии в 87% невидимых клиентских локаций по сравнению с 46% для предыдущей модели Dyna-1.
Исследование показывает, что предсказание видео обеспечивает перенос на данные роботов, позволяя системе учиться на огромных объемах неразмеченного человеческого опыта, а не полагаться на дорогостоящую телеоперацию.