Le projet open-source mlx-smolvla fournit un runtime Python pour exécuter des checkpoints SmolVLA en utilisant MLX sur Apple Silicon, avec une inférence, un serveur de protocole LeRobot et un aperçu pour l'entraînement LoRA. Les benchmarks sur un Apple M5 Pro montrent que la voie MLX atteint une latence médiane de 110,75 ms pour des chunks de 50 actions, ce qui est 1,85× plus rapide que PyTorch-MPS.
- Le runtime est natif MLX sans dépendances Torch ou Transformers.
- Des voies de compatibilité CPU strictes assurent une comparaison déterministe avec PyTorch, tandis que Metal utilise des vérifications statistiques.
- Le projet inclut un serveur de politique implémentant le protocole gRPC d'inférence asynchrone de LeRobot.
- L'entraînement LoRA est actuellement un aperçu de recherche avec une validation de parité limitée.
L'auteur note que les checkpoints bruts de base manquent d'interfaces d'action physique efficaces et nécessitent des checkpoints révisés avec des statistiques de robot correspondantes pour les clients de mouvement.