TRL v1.14 introduit le support de LoRA pour l'AsyncGRPOTrainer, lui permettant d'entraîner un adaptateur Low-Rank Adaptation et de synchroniser uniquement ce petit fichier avec les workers d'inférence vLLM. Cette architecture découple les tâches d'entraînement et de génération sur des machines séparées en utilisant un Storage Bucket partagé comme pont de système de fichiers, éliminant ainsi le besoin de NCCL ou de communication réseau directe entre les nœuds.
- Un adaptateur de rang-1 ne pèse que quelques mégaoctets, ce qui lui permet de transiter par un Storage Bucket monté plutôt que via NCCL.
- Le trainer et les répliques vLLM s'exécutent en tant que Jobs Hugging Face distincts sur différentes machines.
- Un serveur proxy ajoute des en-têtes d'authentification et dirige les rollouts vers la réplique détenant le préfixe KV pertinent tout en diffusant les mises à jour de l'adaptateur.
- Cinq exécutions ont réduit le temps d'entraînement pour 500 étapes de 3 heures 27 minutes à 53 minutes.
Cette configuration permet à l'AsyncGRPOTrainer de fonctionner efficacement dans des environnements distribués où les nœuds ne peuvent pas partager un disque local ou former un groupe NCCL, accélérant considérablement les flux de travail d'apprentissage par renforcement.