Los investigadores proponen ROSA, un sistema de servicio de modelos base de robótica diseñado para fábricas de robots que va más allá de los supuestos de computación en el borde y de un solo robot. El sistema utiliza el servicio compartido de GPU-pool para permitir que flotas de robots accedan a GPUs de clase servidor a través de la red.

  • ROSA adopta el servicio compartido de GPU-pool para mejorar el rendimiento de inferencia, la duración de la batería y la utilización de la GPU en toda la flota.
  • Proporciona una abstracción de programación consciente de la robótica que soporta pipelines multi-modelo, requisitos de rendimiento por tarea y manejo de fallos.
  • El sistema utiliza un enrutamiento impulsado por objetivos de fábrica para maximizar la productividad de la fábrica calificada por SLO en lugar de minimizar la latencia de cada solicitud individual.
  • Implementado con Ray Serve junto a los backends vLLM, PyTorch y JAX, ROSA mejora la productividad de las fábricas hasta 12,06 veces en comparación con los sistemas de servicio dedicados convencionales.

ROSA aborda las limitaciones de los sistemas existentes optimizando los resultados colectivos de la fábrica en lugar de la latencia aislada del robot.