Google DeepMind a publié Gemini Robotics 2, une couche d'intelligence composée de trois modèles conçus pour permettre le contrôle du corps entier, la dextérité à cinq doigts et la collaboration multi-robots. La publication comprend un modèle Vision-Language-Action (VLA), un VLM de raisonnement incarné et un VLA sur appareil, dépassant les capacités précédentes de manipulation sur table.

  • Gemini Robotics 2 VLA pilote des humanoïdes complets comme Apptronik Apollo 2 avec des mains SharpaWave, atteignant des taux de réussite allant de 32 % à 92 % sur les tâches de dextérité.
  • Gemini Robotics ER 2, basé sur Gemini 3.5 Flash, gère la planification de haut niveau et l'orchestration d'outils avec une fenêtre de contexte de 128k et un streaming bidirectionnel via l'API Gemini Live.
  • Gemini Robotics On-Device 2 permet l'exécution locale et une adaptation rapide à de nouveaux corps robotiques, comme la plateforme SO101, où les performances sont passées de 6,7 % à 53,3 % de réussite.
  • La suite prend en charge la collaboration multi-robots, démontrée par l'association d'Apollo 2 avec un Franka F3 Duo pour des transferts de tâches sémantiques partagées.

Les modèles visent à pallier les limites des robots préprogrammés en permettant l'adaptation à des environnements imprévisibles et le transfert de compétences entre différents corps robotiques.