Google DeepMind ha lanzado Gemini Robotics 2, una capa de inteligencia que comprende tres modelos diseñados para habilitar el control de cuerpo completo, la destreza de cinco dedos y la colaboración entre múltiples robots. El lanzamiento incluye un modelo Vision-Language-Action (VLA), un VLM de razonamiento encarnado y un VLA en el dispositivo, superando las capacidades anteriores de manipulación en mesa.
- Gemini Robotics 2 VLA impulsa humanoides completos como Apptronik Apollo 2 con manos SharpaWave, logrando tasas de éxito que oscilan entre el 32% y el 92% en tareas de destreza.
- Gemini Robotics ER 2, basado en Gemini 3.5 Flash, maneja la planificación de alto nivel y la orquestación de herramientas con una ventana de contexto de 128k y transmisión bidireccional a través de la API Gemini Live.
- Gemini Robotics On-Device 2 permite la ejecución local y una rápida adaptación a nuevos cuerpos robóticos, como la plataforma SO101, donde el rendimiento aumentó del 6.7% al 53.3% de éxito.
- El conjunto admite la colaboración entre múltiples robots, demostrado al emparejar Apollo 2 con un Franka F3 Duo para transferencias de tareas semánticas compartidas.
Los modelos tienen como objetivo abordar las limitaciones de los robots preprogramados al permitir la adaptación a entornos impredecibles y la transferencia de habilidades entre diferentes cuerpos robóticos.