Pesquisadores propõem o ROSA, um sistema de serviço para modelos fundamentais de robótica projetado para fábricas de robôs que vai além das premissas de computação de borda para um único robô. O sistema utiliza serviço compartilhado de GPU-pool para permitir que frotas de robôs acessem GPUs de classe de servidor pela rede.

  • O ROSA adota o serviço compartilhado de GPU-pool para melhorar o desempenho de inferência, a duração da bateria e a utilização da GPU em toda a frota.
  • Ele fornece uma abstração de programação consciente de robótica que suporta pipelines multi-modelo, requisitos de desempenho por tarefa e tratamento de falhas.
  • O sistema utiliza escalonamento orientado por objetivos da fábrica para maximizar a produtividade da fábrica qualificada pelo SLO em vez de minimizar a latência de solicitações individuais.
  • Implementado no Ray Serve com backends vLLM, PyTorch e JAX, o ROSA melhora a produtividade da fábrica em até 12,06x em relação aos sistemas de serviço dedicados convencionais.

O ROSA aborda as limitações dos sistemas existentes ao otimizar os resultados coletivos da fábrica em vez da latência isolada do robô.