TRL v1.14 为 AsyncGRPOTrainer 引入了 LoRA 支持,使其能够训练低秩适配适配器,并仅将该小文件同步到 vLLM 推理工作节点。该架构通过使用共享存储桶作为文件系统桥接,将不同机器上的训练和生成作业解耦,消除了节点间对 NCCL 或直接网络通信的需求。

  • rank-1 适配器仅有几兆字节大小,可通过挂载的 Storage Bucket 传输,而非通过 NCCL。
  • 训练器和 vLLM 副本作为独立的 Hugging Face Jobs 运行在不同机器上。
  • 代理服务器添加认证头,并将 rollout 路由到持有相关 KV 前缀的副本,同时广播适配器更新。
  • 五次运行将 500 步的训练时间从 3 小时 27 分钟缩短至 53 分钟。

此设置使 AsyncGRPOTrainer 能够在节点无法共享本地磁盘或形成 NCCL 组的分布式环境中有效运行,显著加速强化学习工作流。