Sujet · Robotics
lab Google DeepMind Blog · il y a 15 j · 9 vues

Google présente Gemini Robotics 2 pour le contrôle du corps entier et la collaboration multi-robots

Google a introduit Gemini Robotics 2, une couche d'intelligence conçue pour fournir aux robots adaptatifs un contrôle intelligent du corps entier, une dextérité avancée et la capacité de collaborer en équipe. Cette mise à jour étend les capacités de l'IA physique au-delà des tâches étroites et répétitives, permettant aux robots de raisonner sur les mouvements et de s'adapter rapidement à de nouveaux corps.

lab Google DeepMind Blog · il y a 15 j · 13 vues

Google lance Gemini Robotics ER 2 avec compréhension vidéo et collaboration multi-robots

Google a lancé Gemini Robotics ER 2, un nouveau modèle de raisonnement incarné conçu pour aider les robots à penser rapidement et à planifier des tâches en plusieurs étapes en temps réel. Cette mise à jour apporte des améliorations significatives par rapport à la version précédente ER 1.6, notamment le suivi continu des progrès basé sur la vidéo, la détection précise des moments clés et des capacités natives de collaboration multi-robots.

lab NVIDIA Research · il y a 9 j · 11 vues

ROSA améliore la productivité des usines jusqu'à 12,06x grâce au service de partage de pools GPU

Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.

lab Meta AI / FAIR Blog · il y a 19 j · 7 vues

L'université de Pittsburgh utilise DINOv3 et SAM de Meta pour le robot d'assistance RAMMP financé par ARPA-H

Les Laboratoires de recherche en ingénierie humaine (HERL) de l'université de Pittsburgh dirigent la plateforme Robotic Assistive Mobility and Manipulation Platform Providing Independence for People with Disabilities (RAMMP), un projet soutenu par jusqu'à 41,5 millions de dollars de financement d'ARPA-H. L'initiative vise à créer des solutions de mobilité assistée plus sûres et plus adaptables pour les utilisateurs de fauteuils roulants en intégrant une robotique avancée aux modèles de vision par ordinateur open source de Meta.

media MarkTechPost · il y a 15 j · 4 vues

Google DeepMind publie Gemini Robotics 2 pour le contrôle du corps entier et la dextérité

Google DeepMind a publié Gemini Robotics 2, une couche d'intelligence composée de trois modèles conçus pour permettre le contrôle du corps entier, la dextérité à cinq doigts et la collaboration multi-robots. La publication comprend un modèle Vision-Language-Action (VLA), un VLM de raisonnement incarné et un VLA sur appareil, dépassant les capacités précédentes de manipulation sur table.

lab Hugging Face Blog · il y a 25 j · 1 vue

NVIDIA lance Cosmos 3 Edge, un modèle de 4 milliards de paramètres pour le contrôle robotique en temps réel sur des appareils edge

NVIDIA a publié Cosmos 3 Edge, un modèle open world de 4 milliards de paramètres conçu pour offrir des performances de niveau data center sur des systèmes edge à mémoire contrainte. Le modèle permet aux robots et aux agents d'IA vision de comprendre leur environnement, de raisonner en temps réel et de générer des actions directement sur des appareils tels que les modules NVIDIA Jetson.

lab Hugging Face Blog · il y a 1 j · 3 vues

Strands Agents intègre LeRobot et les Hugging Face Storage Buckets pour des boucles continues de données robotiques

AWS présente Strands Agents pour permettre une boucle continue d'enregistrement, d'entraînement et de déploiement des politiques robotiques en utilisant les ensembles de données LeRobot et les Hugging Face Storage Buckets. Cette intégration permet aux agents de synchroniser des démonstrations dans des buckets mutables avec déduplication au niveau des octets et de diffuser directement des ensembles de données depuis le Hub pour l'entraînement sans téléchargements complets.

media MarkTechPost · il y a 2 j · 6 vues

Dyna Robotics publie Dyna-2, un modèle d'action-monde pré-entraîné sur 1 million d'heures de vidéo humaine

Dyna Robotics a publié Dyna-2, un modèle d'action-monde pour la manipulation robotique qui a été pré-entraîné sur plus d'un million d'heures de vidéo égocentrique humaine. L'entreprise démontre que la vidéo humaine ordinaire peut remplacer les données étiquetées par action en établissant une loi d'échelle allant de 1 000 à 1 000 000 d'heures.

media Hugging Face Forums · il y a 18 j · 3 vues

Calibra : boîte à outils open-source pour l'observabilité des ensembles de données robotiques

Calibra est une boîte à outils open-source conçue pour aider les chercheurs à auditer les ensembles de données robotiques et à identifier les problèmes de qualité avant d'entraîner des politiques. La première version publique inclut un Espace interactif Robot Dataset Health Check pour auditer les ensembles de données LeRobot et un benchmark de 30 ensembles de données publics LeRobot avec des scores de santé.

lab Hugging Face Blog · il y a 19 j · 23 vues

NVIDIA présente Cosmos-H-Dreams, un simulateur génératif en temps réel pour la robotique chirurgicale

NVIDIA a présenté Cosmos-H-Dreams, un simulateur génératif conditionné par l'action et en temps réel pour la robotique chirurgicale, qui condense les capacités de son Cosmos-H-Surgical-Simulator dans un modèle étudiant causal. Pris en charge par la bibliothèque FlashDreams de NVIDIA dédiée au streaming accéléré d'inférence, le système permet un contrôle interactif par une personne ou une politique apprise en boucle fermée.

lab Hugging Face Blog · il y a 24 j · 8 vues

Aperçu des moteurs de simulation pour l'IA physique : MuJoCo, Isaac Sim et Newton

Cet article fournit un aperçu de l'état actuel de la simulation pour l'IA physique, expliquant comment la simulation comble le manque de données pour la robotique en permettant des environnements d'entraînement évolutifs et photoréalistes. Il décrit un paradigme à trois ordinateurs (entraînement, simulation, sur robot) et classe les principaux moteurs de simulation en fonction de leurs capacités spécifiques et de leurs cas d'utilisation.

media MarkTechPost · il y a 25 j · 6 vues

NVIDIA lance Cosmos 3 Edge, un modèle de monde ouvert de 4 milliards de paramètres pour le raisonnement robotique sur appareil

NVIDIA a publié Cosmos 3 Edge, un modèle de monde ouvert de 4 milliards de paramètres conçu pour fonctionner sur l'appareil même pour les robots et les agents d'IA visuelle. Publié le 20 juillet sur Hugging Face, il permet aux systèmes de comprendre leur environnement, de raisonner en temps réel et de générer des actions robotiques localement sans dépendance au cloud.

lab Hugging Face Blog · il y a 25 j · 2 vues

Pollen Robotics publie Grabette, un système ouvert et peu coûteux pour l'enregistrement de données de manipulation robotique

Pollen Robotics a publié Grabette, un dispositif portable open-source conçu pour enregistrer des données de manipulation robotique du monde réel sans nécessiter de robot ou de rig de téléopération. Le système utilise une caméra grand angle et une caméra de profondeur RGBD pour capturer des trajectoires 6-DoF, permettant aux utilisateurs de générer des ensembles de données propres qui peuvent être traités via un tableau de bord basé sur un navigateur et partagés sur le Hub Hugging Face.

arxiv arXiv cs.LG · il y a 29 j · 2 vues

RoboTTT étend les politiques robotiques à un contexte de 8 000 pas de temps

Les chercheurs présentent RoboTTT, une méthode d'entraînement qui étend le contexte visuo-moteur des modèles de base pour robots jusqu'à 8 000 pas de temps sans augmenter la latence d'inférence. La méthode intègre l'entraînement au moment du test (Test-Time Training) dans les politiques Vision-Language-Action en utilisant des poids rapides mis à jour par descente de gradient pendant l'entraînement et l'inférence.

arxiv arXiv cs.AI · il y a 29 j

RoboTTT étend les politiques robotiques à un contexte de 8 000 pas de temps

NVIDIA présente RoboTTT, un modèle fondamental pour la robotique et une recette d'entraînement qui étendent le contexte visuo-moteur à 8 000 pas de temps sans augmenter la latence d'inférence. En intégrant l'entraînement au moment du test (Test-Time Training) dans les politiques Vision-Language-Action, le système compresse l'historique dans l'espace des poids à l'aide de poids rapides mis à jour par descente de gradient.