Robotics
lab NVIDIA Research · il y a 3 j · 5 vues

ROSA améliore la productivité des usines jusqu'à 12,06x grâce au service de partage de pools GPU

Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.

media MarkTechPost · il y a 9 j · 2 vues

Google DeepMind publie Gemini Robotics 2 pour le contrôle du corps entier et la dextérité

Google DeepMind a publié Gemini Robotics 2, une couche d'intelligence composée de trois modèles conçus pour permettre le contrôle du corps entier, la dextérité à cinq doigts et la collaboration multi-robots. La publication comprend un modèle Vision-Language-Action (VLA), un VLM de raisonnement incarné et un VLA sur appareil, dépassant les capacités précédentes de manipulation sur table.

lab Google DeepMind Blog · il y a 10 j · 4 vues

Google présente Gemini Robotics 2 pour le contrôle du corps entier et la collaboration multi-robots

Google a introduit Gemini Robotics 2, une couche d'intelligence conçue pour fournir aux robots adaptatifs un contrôle intelligent du corps entier, une dextérité avancée et la capacité de collaborer en équipe. Cette mise à jour étend les capacités de l'IA physique au-delà des tâches étroites et répétitives, permettant aux robots de raisonner sur les mouvements et de s'adapter rapidement à de nouveaux corps.

lab Google DeepMind Blog · il y a 10 j · 9 vues

Google lance Gemini Robotics ER 2 avec compréhension vidéo et collaboration multi-robots

Google a lancé Gemini Robotics ER 2, un nouveau modèle de raisonnement incarné conçu pour aider les robots à penser rapidement et à planifier des tâches en plusieurs étapes en temps réel. Cette mise à jour apporte des améliorations significatives par rapport à la version précédente ER 1.6, notamment le suivi continu des progrès basé sur la vidéo, la détection précise des moments clés et des capacités natives de collaboration multi-robots.

media Hugging Face Forums · il y a 12 j · 2 vues

Calibra : boîte à outils open-source pour l'observabilité des ensembles de données robotiques

Calibra est une boîte à outils open-source conçue pour aider les chercheurs à auditer les ensembles de données robotiques et à identifier les problèmes de qualité avant d'entraîner des politiques. La première version publique inclut un Espace interactif Robot Dataset Health Check pour auditer les ensembles de données LeRobot et un benchmark de 30 ensembles de données publics LeRobot avec des scores de santé.

lab Meta AI / FAIR Blog · il y a 13 j · 3 vues

L'université de Pittsburgh utilise DINOv3 et SAM de Meta pour le robot d'assistance RAMMP financé par ARPA-H

Les Laboratoires de recherche en ingénierie humaine (HERL) de l'université de Pittsburgh dirigent la plateforme Robotic Assistive Mobility and Manipulation Platform Providing Independence for People with Disabilities (RAMMP), un projet soutenu par jusqu'à 41,5 millions de dollars de financement d'ARPA-H. L'initiative vise à créer des solutions de mobilité assistée plus sûres et plus adaptables pour les utilisateurs de fauteuils roulants en intégrant une robotique avancée aux modèles de vision par ordinateur open source de Meta.

lab Hugging Face Blog · il y a 13 j · 19 vues

NVIDIA présente Cosmos-H-Dreams, un simulateur génératif en temps réel pour la robotique chirurgicale

NVIDIA a présenté Cosmos-H-Dreams, un simulateur génératif conditionné par l'action et en temps réel pour la robotique chirurgicale, qui condense les capacités de son Cosmos-H-Surgical-Simulator dans un modèle étudiant causal. Pris en charge par la bibliothèque FlashDreams de NVIDIA dédiée au streaming accéléré d'inférence, le système permet un contrôle interactif par une personne ou une politique apprise en boucle fermée.

lab Hugging Face Blog · il y a 19 j · 8 vues

Aperçu des moteurs de simulation pour l'IA physique : MuJoCo, Isaac Sim et Newton

Cet article fournit un aperçu de l'état actuel de la simulation pour l'IA physique, expliquant comment la simulation comble le manque de données pour la robotique en permettant des environnements d'entraînement évolutifs et photoréalistes. Il décrit un paradigme à trois ordinateurs (entraînement, simulation, sur robot) et classe les principaux moteurs de simulation en fonction de leurs capacités spécifiques et de leurs cas d'utilisation.

media MarkTechPost · il y a 19 j · 4 vues

NVIDIA lance Cosmos 3 Edge, un modèle de monde ouvert de 4 milliards de paramètres pour le raisonnement robotique sur appareil

NVIDIA a publié Cosmos 3 Edge, un modèle de monde ouvert de 4 milliards de paramètres conçu pour fonctionner sur l'appareil même pour les robots et les agents d'IA visuelle. Publié le 20 juillet sur Hugging Face, il permet aux systèmes de comprendre leur environnement, de raisonner en temps réel et de générer des actions robotiques localement sans dépendance au cloud.

lab Hugging Face Blog · il y a 19 j · 2 vues

Pollen Robotics publie Grabette, un système ouvert et peu coûteux pour l'enregistrement de données de manipulation robotique

Pollen Robotics a publié Grabette, un dispositif portable open-source conçu pour enregistrer des données de manipulation robotique du monde réel sans nécessiter de robot ou de rig de téléopération. Le système utilise une caméra grand angle et une caméra de profondeur RGBD pour capturer des trajectoires 6-DoF, permettant aux utilisateurs de générer des ensembles de données propres qui peuvent être traités via un tableau de bord basé sur un navigateur et partagés sur le Hub Hugging Face.

lab Hugging Face Blog · il y a 20 j · 1 vue

NVIDIA lance Cosmos 3 Edge, un modèle de 4 milliards de paramètres pour le contrôle robotique en temps réel sur des appareils edge

NVIDIA a publié Cosmos 3 Edge, un modèle open world de 4 milliards de paramètres conçu pour offrir des performances de niveau data center sur des systèmes edge à mémoire contrainte. Le modèle permet aux robots et aux agents d'IA vision de comprendre leur environnement, de raisonner en temps réel et de générer des actions directement sur des appareils tels que les modules NVIDIA Jetson.

arxiv arXiv cs.LG · il y a 23 j · 2 vues

RoboTTT étend les politiques robotiques à un contexte de 8 000 pas de temps

Les chercheurs présentent RoboTTT, une méthode d'entraînement qui étend le contexte visuo-moteur des modèles de base pour robots jusqu'à 8 000 pas de temps sans augmenter la latence d'inférence. La méthode intègre l'entraînement au moment du test (Test-Time Training) dans les politiques Vision-Language-Action en utilisant des poids rapides mis à jour par descente de gradient pendant l'entraînement et l'inférence.

arxiv arXiv cs.AI · il y a 23 j

RoboTTT étend les politiques robotiques à un contexte de 8 000 pas de temps

NVIDIA présente RoboTTT, un modèle fondamental pour la robotique et une recette d'entraînement qui étendent le contexte visuo-moteur à 8 000 pas de temps sans augmenter la latence d'inférence. En intégrant l'entraînement au moment du test (Test-Time Training) dans les politiques Vision-Language-Action, le système compresse l'historique dans l'espace des poids à l'aide de poids rapides mis à jour par descente de gradient.

arxiv arXiv cs.AI · il y a 23 j SWE-bench Pro · 63.2%

Xiaomi lance U0, un modèle de 38 milliards de paramètres pour la synthèse incarnée unifiée

Xiaomi a présenté Xiaomi-Robotics-U0, un modèle multimodal autoregressif de 38 milliards de paramètres conçu pour la synthèse incarnée unifiée. Le modèle traite la génération incarnée comme une extension de la génération d'images et de vidéos fondées sur des modèles de base, optimisant conjointement la génération texte-vers-image, l'édition d'images, la génération de scènes incarnées, le transfert incarné et la génération vidéo incarnée.

arxiv arXiv cs.AI · il y a 27 j · 1 vue

Le cadre post-entraînement PAC-ACT améliore les politiques ACT pour la manipulation de contact de précision

Cet article présente PAC-ACT, un cadre d'entraînement postérieur par renforcement conçu pour améliorer les politiques Action Chunking Transformer (ACT) pré-entraînées pour les tâches industrielles de contact de précision. La méthode reformule l'optimisation des politiques au niveau du chunk et utilise une architecture actor-critic transférée avec ACT et une contrainte hybride de prior comportemental.