TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.
- Un adaptador rank-1 tiene solo unos pocos megabytes, lo que le permite viajar a través de un Storage Bucket montado en lugar de por NCCL.
- El entrenador y las réplicas de vLLM se ejecutan como Hugging Face Jobs separados en diferentes máquinas.
- Un servidor proxy añade cabeceras de autenticación y enruta las rollout hacia la réplica que contiene el prefijo KV relevante mientras difunde actualizaciones del adaptador.
- Cinco ejecuciones redujeron el tiempo de entrenamiento para 500 pasos de 3 horas 27 minutos a 53 minutos.
Esta configuración permite que AsyncGRPOTrainer opere eficazmente en entornos distribuidos donde los nodos no pueden compartir un disco local ni formar un grupo NCCL, acelerando significativamente los flujos de trabajo de aprendizaje por refuerzo.