연구자들은 로봇 공장을 위해 설계된 ROSA라는 로봇 파운데이션 모델 서빙 시스템을 제안하며, 이는 단일 로봇 및 엣지 컴퓨팅 가정에서 벗어나는 것을 목표로 합니다. 이 시스템은 네트워크를 통해 로봇 군집이 서버급 GPU에 접근할 수 있도록 공유 GPU 풀 서빙을 활용합니다.

  • ROSA는 추론 성능, 배터리 지속 시간, 그리고 군집 전반의 GPU 활용도를 향상시키기 위해 공유 GPU 풀 서빙을 채택합니다.
  • 다중 모델 파이프라인, 작업별 성능 요구사항, 그리고 장애 처리를 지원하는 로봇 인식 프로그래밍 추상화를 제공합니다.
  • 이 시스템은 개별 요청 지연 시간을 최소화하는 대신 SLO를 충족하는 공장 생산성을 극대화하기 위해 공장 목표 기반 스케줄링을 사용합니다.
  • Ray Serve와 vLLM, PyTorch, JAX 백엔드 위에 구현된 ROSA는 기존 전용 서빙 시스템 대비 공장 생산성을 최대 12.06배 향상시킵니다.

ROSA는 개별 로봇의 지연 시간 대신 집단적인 공장 결과를 최적화함으로써 기존 시스템의 한계를 해결합니다.