Sujet · Robotics
lab Microsoft Research Blog · il y a 7 j · 28 vues

Microsoft Research montre que le déchargement de l'inférence d'IA physique améliore les performances et l'autonomie des robots

Microsoft Research remet en question l'hypothèse selon laquelle l'inférence d'IA physique doit s'exécuter exclusivement sur les GPU embarqués des robots, démontrant que le déchargement vers une infrastructure edge ou cloud améliore considérablement les charges de travail de manipulation mobile. Leur étude systématique des charges de travail robotiques révèle que la dépendance au calcul embarqué limite les performances, l'autonomie et l'évolutivité.

arxiv arXiv cs.AI · il y a 7 j · 9 vues

Shanghai AI Lab publie InternW0, un modèle du monde physique pour des interactions réelles efficaces

Le Shanghai AI Laboratory a présenté InternW0, la première incarnation de sa série de modèles du monde physique InternW, conçue pour maintenir des prédictions exploitables dans des environnements dynamiques. Le modèle apprend conjointement les dynamiques visuelles futures et le contrôle continu des robots à l'aide d'une architecture vidéo-action asymétrique avec appariement par flux.

lab Hugging Face Blog · il y a 7 j · 16 vues

NVIDIA Warp et MjWarp permettent la simulation robotique parallèle accélérée par GPU

MuJoCo Warp (MJWarp), construit sur NVIDIA Warp, permet aux modèles MuJoCo compatibles de s'exécuter à l'échelle du GPU, permettant le déploiement de centaines ou de milliers de mondes de simulation indépendants en un seul appel. Cette architecture déplace le focus de la minimisation de la latence pour un environnement unique vers l'amélioration du débit agrégé, ce qui favorise l'apprentissage par renforcement et l'échantillonnage à grande échelle.

arxiv arXiv cs.AI · il y a 21 j · 21 vues

Show-Harness permet aux agents VLM de contrôler des robots via une interface sémantique compacte

Les auteurs présentent Show-Harness, un Harness Incarné qui permet aux modèles de vision et de langage (VLM) de contrôler des robots via une interface sémantique compacte reliant l'intention à l'action. Ce système expose des unités d'action sémantiques discrètes pour le raisonnement VLM et utilise des interprètes spécifiques à l'incarnation pour les ancrer dans les actions locales du robot.