Pesquisadores propõem o ROSA, um sistema de serviço para modelos fundamentais de robótica projetado para fábricas de robôs que vai além das premissas de computação de borda para um único robô. O sistema utiliza serviço compartilhado de GPU-pool para permitir que frotas de robôs acessem GPUs de classe de servidor pela rede.
- O ROSA adota o serviço compartilhado de GPU-pool para melhorar o desempenho de inferência, a duração da bateria e a utilização da GPU em toda a frota.
- Ele fornece uma abstração de programação consciente de robótica que suporta pipelines multi-modelo, requisitos de desempenho por tarefa e tratamento de falhas.
- O sistema utiliza escalonamento orientado por objetivos da fábrica para maximizar a produtividade da fábrica qualificada pelo SLO em vez de minimizar a latência de solicitações individuais.
- Implementado no Ray Serve com backends vLLM, PyTorch e JAX, o ROSA melhora a produtividade da fábrica em até 12,06x em relação aos sistemas de serviço dedicados convencionais.
O ROSA aborda as limitações dos sistemas existentes ao otimizar os resultados coletivos da fábrica em vez da latência isolada do robô.