Google ha lanzado Gemini Robotics ER 2, un nuevo modelo de razonamiento encarnado diseñado para ayudar a los robots a pensar rápido y planificar tareas en varios pasos en tiempo real. La actualización introduce mejoras significativas respecto a la versión anterior ER 1.6, incluyendo seguimiento continuo del progreso basado en video, localización precisa de momentos y capacidades nativas de colaboración entre múltiples robots.

  • La clasificación del progreso alcanza una precisión del 57.4% en cinco niveles para ayudar a los robots a ajustar las acciones sobre la marcha.
  • La localización de momentos alcanza una precisión del 91.3% con una distancia absoluta media de 0.96s, permitiendo un cambio preciso de tareas a 4 veces la velocidad de ejecución de modelos anteriores.
  • La colaboración entre múltiples robots permite que diversas máquinas se comuniquen mediante comprensión semántica compartida para completar flujos de trabajo complejos.
  • Las mejoras en inteligencia espacial incluyen detección de éxito/fracaso en video sin procesar y lectura generalizada de instrumentos en 10 tipos.
  • Los benchmarks de seguridad muestran avances en el seguimiento de instrucciones y la detección de proximidad humana, permitiendo que los robots se detengan cuando hay personas cerca.

El modelo ya está disponible públicamente para desarrolladores a través de Gemini API y Google AI Studio, habilitando tareas de IA física más útiles mediante una orquestación fluida sin pausas de detención y reflexión.