Google DeepMind 发布了 Gemini Robotics 2,这是一个由三个模型组成的智能层,旨在实现全身控制、五指灵巧操作以及多机器人协作。此次发布包括一个视觉-语言-动作(VLA)模型、一个具身推理 VLM 和一个端侧 VLA,突破了以往仅局限于桌面操作的能力。

  • Gemini Robotics 2 VLA 驱动搭载 SharpaWave 手部的 Apptronik Apollo 2 全身人形机器人,在灵巧任务中的成功率介于 32% 至 92% 之间。
  • Gemini Robotics ER 2 基于 Gemini 3.5 Flash,利用 128k 上下文窗口和通过 Gemini Live API 实现的双向流式传输,处理高层规划与工具编排。
  • Gemini Robotics On-Device 2 支持本地执行及对新机器人本体(如 SO101 平台)的快速适应,其成功率从 6.7% 跃升至 53.3%。
  • 该套件支持多机器人协作,演示中将 Apollo 2 与 Franka F3 Duo 配对,实现了共享语义任务的交接。

这些模型旨在通过使机器人能够适应不可预测的环境以及在不同机器人本体间迁移技能,来解决预编程机器人的局限性。