O TRL v1.14 introduz suporte ao LoRA no AsyncGRPOTrainer, permitindo que ele treine um adaptador de Adaptação de Baixo Ranque e sincronize apenas esse pequeno arquivo com os workers de inferência do vLLM. Essa arquitetura desacopla os jobs de treinamento e geração em máquinas separadas, usando um Storage Bucket compartilhado como ponte de sistema de arquivos, eliminando a necessidade de NCCL ou comunicação direta de rede entre nós.
- Um adaptador rank-1 tem apenas alguns megabytes, permitindo que ele seja transferido por meio de um Storage Bucket montado em vez de via NCCL.
- O trainer e as réplicas do vLLM são executados como Jobs separados do Hugging Face em máquinas diferentes.
- Um servidor proxy adiciona cabeçalhos de autenticação e roteia os rollouts para a réplica que contém o prefixo KV relevante, enquanto transmite atualizações do adaptador.
- Cinco execuções reduziram o tempo de treinamento para 500 etapas de 3 horas e 27 minutos para 53 minutos.
Essa configuração permite que o AsyncGRPOTrainer opere efetivamente em ambientes distribuídos onde os nós não podem compartilhar um disco local ou formar um grupo NCCL, acelerando significativamente os fluxos de trabalho de aprendizado por reforço.