Robotics
media MarkTechPost · há 9 d · 2 visualizações

Google DeepMind lança Gemini Robotics 2 para controle do corpo inteiro e destreza

O Google DeepMind lançou o Gemini Robotics 2, uma camada de inteligência composta por três modelos projetados para habilitar controle do corpo inteiro, destreza com cinco dedos e colaboração entre múltiplos robôs. O lançamento inclui um modelo Vision-Language-Action (VLA), um VLM de raciocínio corporificado e um VLA para dispositivos locais, superando as capacidades anteriores de manipulação em mesas.

lab Google DeepMind Blog · há 10 d · 4 visualizações

Google apresenta Gemini Robotics 2 para controle de corpo inteiro e colaboração entre múltiplos robôs

A Google introduziu o Gemini Robotics 2, uma camada de inteligência projetada para fornecer a robôs adaptáveis um controle inteligente de corpo inteiro, destreza avançada e capacidade de colaborar em equipes. Esta atualização expande as capacidades da IA física além de tarefas estreitas e repetitivas, permitindo que os robôs raciocinem sobre movimentos e se adaptem rapidamente a novos corpos.

lab Google DeepMind Blog · há 10 d · 9 visualizações

Google lança o Gemini Robotics ER 2 com compreensão de vídeo e colaboração entre múltiplos robôs

A Google lançou o Gemini Robotics ER 2, um novo modelo de raciocínio corporificado projetado para ajudar os robôs a pensar rápido e planejar tarefas em múltiplos passos em tempo real. A atualização traz melhorias significativas em relação à versão anterior ER 1.6, incluindo rastreamento contínuo do progresso com base em vídeo, localização precisa de momentos-chave e capacidades nativas de colaboração entre múltiplos robôs.

media Hugging Face Forums · há 12 d · 2 visualizações

Calibra: toolkit de código aberto para observabilidade de conjuntos de dados de robôs

O Calibra é um toolkit de código aberto projetado para ajudar pesquisadores a auditar conjuntos de dados de robôs e identificar problemas de qualidade antes de treinar políticas. O primeiro lançamento público inclui um Espaço interativo Robot Dataset Health Check para auditar conjuntos de dados LeRobot e uma avaliação comparativa de 30 conjuntos de dados públicos do LeRobot com pontuações de saúde.

lab Meta AI / FAIR Blog · há 13 d · 3 visualizações

Universidade de Pittsburgh usa DINOv3 e SAM da Meta para robô assistivo ARPA-H financiado pelo projeto RAMMP

Os Laboratórios de Pesquisa em Engenharia Humana (HERL) da Universidade de Pittsburgh estão liderando a Plataforma Robótica de Mobilidade e Manipulação Assistiva que Fornece Independência para Pessoas com Deficiência (RAMMP), um projeto apoiado por até US$ 41,5 milhões em financiamento do ARPA-H. A iniciativa visa criar soluções de mobilidade assistiva mais seguras e adaptáveis para usuários de cadeiras de rodas, integrando robótica avançada aos modelos de visão por IA de código aberto da Meta.

lab Hugging Face Blog · há 13 d · 19 visualizações

NVIDIA apresenta Cosmos-H-Dreams, um simulador generativo em tempo real para robótica cirúrgica

A NVIDIA apresentou o Cosmos-H-Dreams, um simulador generativo em tempo real e condicionado a ações para robótica cirúrgica que destila as capacidades de seu Cosmos-H-Surgical-Simulator em um modelo estudante causal. Atendido por meio da biblioteca FlashDreams da NVIDIA, otimizada para streaming-inference acelerado, o sistema permite controle interativo por uma pessoa ou política aprendida em loop fechado.

lab Hugging Face Blog · há 19 d · 8 visualizações

Visão geral dos motores de simulação para IA Física: MuJoCo, Isaac Sim e Newton

Este artigo apresenta uma visão geral do estado atual da simulação para IA Física, explicando como a simulação preenche a lacuna de dados para robótica ao permitir ambientes de treinamento escaláveis e fotorrealistas. Ele descreve um paradigma de três computadores (treinamento, simulação e no robô) e categoriza os principais motores de simulação com base em suas capacidades específicas e casos de uso.

media MarkTechPost · há 19 d · 4 visualizações

NVIDIA lança Cosmos 3 Edge, um modelo de mundo aberto com 4B para raciocínio robótico em dispositivo

A NVIDIA lançou o Cosmos 3 Edge, um modelo de mundo aberto com 4 bilhões de parâmetros projetado para rodar em dispositivo para robôs e agentes de IA de visão. Lançado em 20 de julho no Hugging Face, ele permite que sistemas entendam o ambiente, raciocinem em tempo real e gerem ações roboticamente localmente, sem dependência da nuvem.

lab Hugging Face Blog · há 19 d · 2 visualizações

Pollen Robotics lança o Grabette, um sistema aberto e de baixo custo para gravação de dados de manipulação por robôs

A Pollen Robotics lançou o Grabette, um dispositivo portátil de código aberto projetado para registrar dados de manipulação robótica do mundo real sem exigir um robô ou uma estrutura de teleoperação. O sistema utiliza uma câmera olho de peixe e uma câmera de profundidade RGBD para capturar trajetórias 6-DoF, permitindo que os usuários gerem conjuntos de dados limpos que podem ser processados por meio de um painel baseado em navegador e compartilhados no Hugging Face Hub.

lab Hugging Face Blog · há 20 d · 1 visualização

NVIDIA lança Cosmos 3 Edge, um modelo de 4 bilhões de parâmetros para controle de robôs em tempo real em dispositivos de borda

A NVIDIA lançou o Cosmos 3 Edge, um modelo de mundo aberto com 4 bilhões de parâmetros projetado para oferecer desempenho de nível de data center em sistemas de borda com memória limitada. O modelo permite que robôs e agentes de IA de visão compreendam seu entorno, raciocinem em tempo real e gerem ações diretamente em dispositivos como os módulos NVIDIA Jetson.

arxiv arXiv cs.LG · há 23 d · 2 visualizações

RoboTTT escala políticas robóticas para contexto de 8 mil etapas

Pesquisadores apresentam o RoboTTT, uma receita de treinamento que estende o contexto visuomotor para modelos fundamentais de robótica até 8.000 etapas sem aumentar a latência de inferência. O método integra Treinamento no Momento do Teste em políticas Visão-Linguagem-Ação usando pesos rápidos atualizados por descida de gradiente durante tanto o treinamento quanto a inferência.

arxiv arXiv cs.AI · há 23 d SWE-bench Pro · 63.2%

Xiaomi lança o U0, um modelo de 38B parâmetros para síntese corporal unificada

A Xiaomi apresentou o Xiaomi-Robotics-U0, um modelo autoregressivo multimodal de 38 bilhões de parâmetros projetado para síntese corporal unificada. O modelo trata a geração corporal como uma extensão da geração de imagens e vídeos de base, otimizando conjuntamente a geração de texto para imagem, edição de imagens, geração de cenas corporais, transferência corporal e geração de vídeo corporal.

arxiv arXiv cs.AI · há 27 d · 1 visualização

Framework de pós-treinamento PAC-ACT melhora políticas ACT para manipulação de contato de precisão

Este artigo apresenta o PAC-ACT, um framework de pós-treinamento baseado em aprendizado por reforço projetado para aprimorar políticas do Action Chunking Transformer (ACT) pré-treinadas para tarefas industriais de contato de precisão. O método reformula a otimização da política no nível de chunk e utiliza uma arquitetura actor-critic transferida com ACT, juntamente com uma restrição híbrida de prior de comportamento.