Google a lancé Gemini Robotics ER 2, un nouveau modèle de raisonnement incarné conçu pour aider les robots à penser rapidement et à planifier des tâches en plusieurs étapes en temps réel. Cette mise à jour apporte des améliorations significatives par rapport à la version précédente ER 1.6, notamment le suivi continu des progrès basé sur la vidéo, la détection précise des moments clés et des capacités natives de collaboration multi-robots.
- La classification des progrès atteint une précision de 57,4 % sur cinq niveaux pour aider les robots à ajuster leurs actions en temps réel.
- La détection des moments clés atteint une précision de 91,3 % avec une distance absolue moyenne de 0,96 s, permettant un changement de tâche précis à 4 fois la vitesse d'exécution des modèles précédents.
- La collaboration multi-robots permet à des machines diverses de communiquer via une compréhension sémantique partagée pour achever des workflows complexes.
- Les améliorations de l'intelligence spatiale incluent la détection de succès/échec sur la vidéo brute et la lecture généralisée d'instruments sur 10 types.
- Les benchmarks de sécurité montrent des progrès dans le respect des instructions et la détection de proximité humaine, permettant aux robots de s'arrêter lorsque des personnes sont à proximité.
Le modèle est désormais disponible publiquement pour les développeurs via l'API Gemini et Google AI Studio, permettant des tâches d'IA physique plus utiles grâce à une orchestration fluide sans pauses de type « arrêt-penser ».