Google DeepMind выпустила Gemini Robotics 2, интеллектуальный слой, состоящий из трех моделей, предназначенных для обеспечения управления всем телом, ловкости пяти пальцев и взаимодействия нескольких роботов. В релиз включена модель Vision-Language-Action (VLA), воплощенная модель VLM для рассуждений и локальная VLA, что выходит за рамки предыдущих возможностей манипуляции на столе.

  • Gemini Robotics 2 VLA управляет полноразмерными гуманоидами, такими как Apptronik Apollo 2 с руками SharpaWave, достигая показателей успешности от 32% до 92% в задачах на ловкость.
  • Gemini Robotics ER 2, основанная на Gemini 3.5 Flash, занимается высокоуровневым планированием и оркестровкой инструментов, используя контекстное окно на 128k и двунаправленную потоковую передачу через Gemini Live API.
  • Gemini Robotics On-Device 2 позволяет выполнять вычисления локально и быстро адаптироваться к новым роботизированным платформам, таким как SO101, где показатель успешности вырос с 6.7% до 53.3%.
  • Пакет поддерживает взаимодействие нескольких роботов, что продемонстрировано на примере пары Apollo 2 и Franka F3 Duo для совместного выполнения задач с передачей семантических данных.

Модели призваны устранить ограничения запрограммированных роботов, обеспечив адаптацию к непредсказуемым условиям и перенос навыков между различными роботизированными платформами.