Para peneliti mengusulkan ROSA, sebuah sistem penyajian model dasar robotika yang dirancang untuk pabrik robot yang melampaui asumsi komputasi tepi satu robot. Sistem ini memanfaatkan penyajian GPU-pool bersama agar armada robot dapat mengakses GPU kelas server melalui jaringan.
- ROSA mengadopsi penyajian GPU-pool bersama untuk meningkatkan kinerja inferensi, durasi baterai, dan utilisasi GPU di seluruh armada.
- Sistem ini menyediakan abstraksi pemrograman yang sadar robotika, mendukung pipa multi-model, persyaratan kinerja per-tugas, dan penanganan kegagalan.
- Sistem menggunakan penjadwalan berbasis tujuan pabrik untuk memaksimalkan produktivitas pabrik yang memenuhi SLO, bukan meminimalkan latensi permintaan individu.
- Diimplementasikan pada Ray Serve dengan backend vLLM, PyTorch, dan JAX, ROSA meningkatkan produktivitas pabrik hingga 12,06x dibandingkan sistem penyajian khusus konvensional.
ROSA mengatasi keterbatasan sistem yang ada dengan mengoptimalkan hasil kolektif pabrik alih-alih latensi robot terisolasi.