Исследователи предлагают ROSA, систему обслуживания базовой модели робототехники, предназначенную для роботизированных фабрик и выходящую за рамки предположений об обслуживании отдельных роботов на периферийных вычислениях. Система использует обслуживание через общий пул GPU, позволяя флотам роботов получать доступ к серверным GPU по сети.
- ROSA применяет обслуживание через общий пул GPU для повышения производительности вывода, времени работы от батареи и утилизации GPU во всём флоте.
- Она предоставляет абстракцию программирования, учитывающую специфику робототехники, поддерживающую конвейеры из нескольких моделей, требования к производительности для каждой задачи и обработку сбоев.
- Система использует планирование, ориентированное на фабричные цели, чтобы максимизировать производительность фабрики, соответствующую требованиям SLO, а не минимизировать задержку отдельных запросов.
- Реализованная на Ray Serve с бэкендами vLLM, PyTorch и JAX, ROSA повышает производительность фабрики до 12,06x по сравнению с традиционными системами выделенного обслуживания.
ROSA решает ограничения существующих систем за счёт оптимизации коллективных результатов работы фабрики вместо изолированной задержки отдельных роботов.