A Google lançou o Gemini Robotics ER 2, um novo modelo de raciocínio corporificado projetado para ajudar os robôs a pensar rápido e planejar tarefas em múltiplos passos em tempo real. A atualização traz melhorias significativas em relação à versão anterior ER 1.6, incluindo rastreamento contínuo do progresso com base em vídeo, localização precisa de momentos-chave e capacidades nativas de colaboração entre múltiplos robôs.
- A classificação do progresso atinge 57,4% de precisão em cinco níveis para ajudar os robôs a ajustar ações dinamicamente.
- A localização de momentos-chave alcança 91,3% de precisão com uma distância absoluta média de 0,96s, permitindo troca precisa de tarefas a 4x a velocidade de execução dos modelos anteriores.
- A colaboração entre múltiplos robôs permite que máquinas diversas se comuniquem por meio de compreensão semântica compartilhada para concluir fluxos de trabalho complexos.
- As melhorias na inteligência espacial incluem detecção de sucesso/fracasso em vídeo bruto e leitura generalizada de instrumentos em 10 tipos.
- Os benchmarks de segurança mostram ganhos no seguimento de instruções e na detecção de proximidade humana, permitindo que os robôs parem quando pessoas estão por perto.
O modelo está agora disponível publicamente para desenvolvedores por meio da Gemini API e do Google AI Studio, habilitando tarefas mais úteis de IA física por meio de orquestração fluida sem pausas para parar e pensar.