Les chercheurs proposent ROSA, un système de déploiement de modèle fondamental pour la robotique conçu pour les usines de robots qui va au-delà des hypothèses de calcul en périphérie pour un seul robot. Le système utilise le service de partage de pools GPU pour permettre aux flottes de robots d'accéder à des GPUs de classe serveur via le réseau.
- ROSA adopte le service de partage de pools GPU pour améliorer les performances d'inférence, la durée de vie de la batterie et l'utilisation du GPU au sein d'une flotte.
- Il fournit une abstraction de programmation consciente de la robotique prenant en charge les pipelines multi-modèles, les exigences de performance par tâche et la gestion des échecs.
- Le système utilise un ordonnancement piloté par les objectifs de l'usine pour maximiser la productivité de l'usine qualifiée selon les SLO plutôt que de minimiser la latence de chaque requête individuelle.
- Implémenté sur Ray Serve avec les backends vLLM, PyTorch et JAX, ROSA améliore la productivité des usines jusqu'à 12,06x par rapport aux systèmes de déploiement dédiés conventionnels.
ROSA comble les lacunes des systèmes existants en optimisant les résultats collectifs de l'usine au lieu de la latence isolée du robot.