O Google DeepMind lançou o Gemini Robotics 2, uma camada de inteligência composta por três modelos projetados para habilitar controle do corpo inteiro, destreza com cinco dedos e colaboração entre múltiplos robôs. O lançamento inclui um modelo Vision-Language-Action (VLA), um VLM de raciocínio corporificado e um VLA para dispositivos locais, superando as capacidades anteriores de manipulação em mesas.
- O Gemini Robotics 2 VLA controla humanoides completos como o Apptronik Apollo 2 com mãos SharpaWave, alcançando taxas de sucesso que variam de 32% a 92% em tarefas de destreza.
- O Gemini Robotics ER 2, baseado no Gemini 3.5 Flash, lida com planejamento de alto nível e orquestração de ferramentas com uma janela de contexto de 128k e streaming bidirecional por meio da API Gemini Live.
- O Gemini Robotics On-Device 2 permite execução local e adaptação rápida a novos corpos robóticos, como a plataforma SO101, onde o desempenho saltou de 6,7% para 53,3% de sucesso.
- A suíte suporta colaboração entre múltiplos robôs, demonstrada ao parear o Apollo 2 com um Franka F3 Duo para transferências compartilhadas de tarefas semânticas.
Os modelos visam superar as limitações dos robôs pré-programados, permitindo adaptação a ambientes imprevisíveis e transferência de habilidades entre diferentes corpos robóticos.