Microsoft Research remet en question l'hypothèse selon laquelle l'inférence d'IA physique doit s'exécuter exclusivement sur les GPU embarqués des robots, démontrant que le déchargement vers une infrastructure edge ou cloud améliore considérablement les charges de travail de manipulation mobile. Leur étude systématique des charges de travail robotiques révèle que la dépendance au calcul embarqué limite les performances, l'autonomie et l'évolutivité.

  • Le déchargement de l'inférence a amélioré les taux de réussite des tâches de cartographie, planification, navigation et manipulation en réduisant la latence et en permettant l'utilisation de modèles d'IA plus grands.
  • Les GPU embarqués ont ralenti la cartographie et la planification jusqu'à 383 % par rapport à un A100, tandis que la navigation a subi une baisse de 30 % dans la détection rapide des obstacles.
  • Les précisions des modèles VLA ont chuté de 50 % sur les GPU embarqués plus petits en raison des ralentissements, alors que l'inférence déchargée a efficacement boosté les opérations.
  • Le remplacement des GPU embarqués gourmands en énergie par du matériel léger et une inférence distante a amélioré la durée de vie de la batterie du robot Stretch-3 de plus de 100 %, car les grands GPU embarqués comme Jetson Thor drainent les batteries jusqu'à 160 %.

Les auteurs soutiennent que les systèmes d'inférence distribués sont essentiels pour que les robots fonctionnent efficacement dans des environnements ouverts et imprévisibles avec de grands modèles et des temps d'opération prolongés.