TRL v1.14는 AsyncGRPOTrainer에 LoRA 지원을 도입하여 Low-Rank Adaptation 어댑터를 학습하고 해당 작은 파일만 vLLM 추론 작업자에 동기화할 수 있게 합니다. 이 아키텍처는 공유 스토리지 버킷을 파일 시스템 브릿지로 사용하여 별도의 머신에서 학습 및 생성 작업을 분리함으로써 노드 간 NCCL 또는 직접 네트워크 통신의 필요성을 제거합니다.

  • rank-1 어댑터는 몇 메가바이트에 불과하여 NCCL을 통해 전송되는 대신 마운트된 스토리지 버킷을 통해 이동할 수 있습니다.
  • 트레이너와 vLLM 복제본은 서로 다른 머신에서 별도의 Hugging Face Jobs로 실행됩니다.
  • 프록시 서버는 인증 헤더를 추가하고 관련 KV 접두사를 보유한 복제본으로 롤아웃을 라우팅하며 어댑터 업데이트를 브로드캐스트합니다.
  • 5회 실행 결과 500 단계에 대한 학습 시간이 3시간 27분에서 53분으로 단축되었습니다.

이 설정은 노드가 로컬 디스크를 공유하거나 NCCL 그룹을 형성할 수 없는 분산 환경에서 AsyncGRPOTrainer가 효과적으로 작동하도록 하여 강화 학습 워크플로우를 크게 가속화합니다.